본문 바로가기
인사이트 리포트
인사이트 리포트
AI 시대, 기업 데이터의 재발견: 버려지던 데이터가 원유가 되다 AI 시대, 기업 데이터의 재발견: 버려지던 데이터가 원유가 되다
AX

AI 시대, 기업 데이터의 재발견: 버려지던 데이터가 원유가 되다

김영욱
2026-09-23

기업 데이터가 단순한 기록에서 AI 에이전트 훈련을 위한 전략적 자산으로 변하는 이유와, 규제 환경 속에서 데이터 활용 능력을 증명하는 데이터 거버넌스 전략을 분석합니다.

Executive Summary

  • 공개 웹 데이터의 고갈과 '데이터 배기가스'의 가치 상승: 기업 내부에 방치되었던 일상적 업무 기록인 '데이터 배기가스(Data Exhaust)'가 AI 에이전트의 성능을 결정짓는 가장 희소하고 값진 훈련 자산으로 재평가되고 있습니다.
  • 정적 데이터 제공에서 '역량 이전'의 환경 구축으로 진화: AI 학습의 수요가 '강화학습 환경' 구축으로 이동함에 따라, 데이터 거래의 본질이 '기록의 판매'에서 '기업 역량의 이전'으로 확장되고 있습니다.
  • 보유를 넘어 '증명'하는 데이터 거버넌스가 새로운 경쟁 우위: 데이터를 안전하고 합법적으로 활용할 수 있음을 입증하는 '데이터 거버넌스' 역량이 AI 시대의 실질적인 해자가 됩니다.

파산한 항공사가 남긴 비싼 자산

지난 5월 파산한 저가 항공사 Spirit은 남은 자산을 경매에 부쳤다. 비행기와 라과디아공항의 이착륙 슬롯, 플로리다 본사 건물이 차례로 팔렸다. 그런데 가장 치열한 입찰 경쟁이 붙은 자산은 활주로 위에 있지 않았다. 1억 통의 이메일과 5억 건의 마이크로소프트 팀즈 메시지, 그리고 수십 년 치 운영 기록이었다. 구글이 이 데이터를 1천만 달러에 낙찰받았다.[1] 파산한 항공사가 남긴 가장 값진 잔존물은 비행기가 아니라, 직원들이 매일 어떻게 일했는지를 담은 업무의 부산물, 이른바 데이터 배기가스(Data Exhaust, 사용자 행동 과정에서 부수적으로 생성되는 흔적 데이터)였다.

[그림 1] Spirit 항공사가 남긴 자산 비교 (출처: Axios[2])
Spirit 항공 파산 자산 매각 비교(2026) 차트로 매각액은 백만 달러 기준. 라과디아 공항 슬롯(JetBlue 인수) $58.5M, 기업 데이터(구글 인수) $10.0M - 데이터 경매 입찰 경쟁(구글 $10.0M 낙찰 · Mercor $7.5M 백업)

공개된 인터넷 데이터가 이미 남김없이 긁어모아진 상황에서 이런 현상은 우연이 아니다. 모든 프론티어 모델이 같은 인터넷 텍스트 위에서 학습했고, 그 원천에서 나오던 품질 우위는 소진됐다. 이제 데이터 품질의 차이를 만드는 것은, 기업이 오랫동안 비용이나 쓰레기로 취급하던 일상의 기록이다. 슬랙 대화, 회의록, 고객 대응 이력, 코드 변경 내역처럼 별 효용이 없어 보이던 데이터가, 정작 '진짜 사람이 진짜 일을 하는 방식'을 담고 있어 가장 비싼 훈련 재료가 됐다. 기업 데이터가 대차대조표 밖의 배기가스에서, 값이 매겨지는 자산으로 재평가되고 있다.

변화는 여기서 멈추지 않는다. 수요는 정적 데이터를 넘어, 에이전트가 실제 업무를 시행착오로 익히는 강화학습 환경으로 옮겨가고 있다. 요구가 '데이터를 달라'에서 '너의 일하는 방식을 재현하게 해달라'로 바뀌면, 이것은 데이터 거래가 아니라 역량의 이전이 된다. 그리고 이 흐름은 양날을 가진다. 방치된 데이터를 자산으로 바꾸는 기회인 동시에, 프라이버시와 계약, 지식재산의 위험을 떠안고 때로는 자기 자리를 대체할 모델을 스스로 훈련시키는 역설이기도 하다.

국내 기업에 이 재평가는 특히 무겁다. 제조와 물류, 유통, 통신, 금융에서 수십 년간 쌓인 운영 데이터는 잠재적 자산의 보고이지만, 개인정보보호법의 벽 앞에서 그대로 현금화되지 않는다. 결국 이 자산을 실현하는 것은 데이터를 '가진' 기업이 아니라, 출처와 권리, 동의와 비식별화를 갖춰 합법적으로 활용할 수 있음을 '증명'하는 기업이다.

1. 버려지던 데이터가 원유가 되다

Spirit의 예는 빠르게 형성되는 기업 데이터 시장의 단면이다. 무엇이 사고 팔리고 있으며, 어떤 가치에 값이 매겨지는지를 보여준다.

무엇이 팔리는가

거래 대상은 기업이 오랫동안 지워도 그만이라 여기던 것들이다. 슬랙이나 팀즈의 대화 스레드, 깃허브의 코드 변경 이력, 아사나(Asana)와 구글 드라이브에 쌓인 문서, 몇 년 치 회의록, 고객과 주고받은 대응 기록과 같은 것들이다. AI 에이전트 스타트업 웜리(Warmly)는 지난 6월 허브스팟에 인수되기로 합의한 지 8일 만에, 코드베이스와 업무 기록, 직원 간 커뮤니케이션을 최대 30만 달러에 사거나 라이선싱하겠다는 제안을 받았다. 웜리는 나흘간 같은 종류의 제안을 네 건 받았고, 모두 거절했다.[3] 가장 값나가는 것은 잘 정리된 슬라이드나 완성된 결과물이 아니라, 사람이 문제를 어떻게 풀어가는지가 고스란히 남은 일상의 흔적이다. 영상도 예외가 아니다. 비드야드(Vidyard)가 가진 방대한 영상 가운데 AI 기업들이 특히 원하는 것은, 사람이 세일즈포스나 허브스팟 같은 SaaS를 다루는 장면, 그리고 무언가 잘못됐을 때 어떻게 대응하는지가 담긴 화면이다.

시장이 생기다

이 거래를 매개하는 중개 계층은 이미 자리 잡았다. Mercor, Turing, Protege, Integral 같은 기업들이 스타트업의 데이터를 사거나 빌려, 개인식별정보를 지운 뒤 모델을 훈련하는 랩에 되판다. 규모는 가파르다. 데이터의 합법적 판매 가능 여부를 검증하는 중개사 Protege의 거래 취급액은 지난해 3천만 달러에서 올해 1억 달러 이상으로 뛰었다. 이 회사는 거래액의 25~30%를 수수료로 가져간다. 파는 쪽은 대개 문을 닫거나 팔리는 스타트업, 또는 몇 년째 투자를 받지 못한 회사들이다. 파산 절차도 공급원이 된다. Spirit의 데이터가 채권 변제를 위한 경매에 오른 것처럼, 실패한 기업의 이메일과 Slack이 마지막 현금이 되는 시장이 만들어지고 있다.

자산이 되다

값이 매겨지자 데이터는 기업과 분리된 독립 자산이 됐다. 데이터는 이제 대차대조표 밖의 부산물이 아니라, 그 자체로 값이 매겨지고, 회사와 떼어져 거래되며, 때로는 회사보다 오래 살아남는 자산이다. 웜리가 7년에 걸쳐 쌓은 3억 3천만 건의 고객 접점 데이터가 인수 이후에도 별도의 매입 대상이 된 것이 그 증거다. 그렇다면 왜 하필 이런 데이터인가. 다음 장에서 살핀다.

2. 왜 지금, 왜 이 데이터인가

이 장은 왜 하필 지금, 왜 이 데이터인가를 묻는다. 답은 두 방향에서 온다. 공급이 마르고 있고, 정작 필요한 것이 공개 웹과 인터넷상에 없기 때문이다.

공개 웹이 마르고 있다

오픈AI의 수츠케버는 데이터를 AI의 화석연료에 빗대며, 인터넷은 하나뿐이고 그 텍스트는 유한하다고 말했다. Epoch AI는 여기에 숫자를 붙였다. 품질과 중복을 보정한 인간 생성 공개 텍스트의 유효 총량은 약 300조 토큰이며, 현재 추세라면 프론티어 랩들은 가장 유력하게는 2028년 무렵 이 재고를 소진한다.[4] 물론 시점에는 이견이 있고, 합성 데이터 같은 우회로도 논의된다. 그러나 시장의 행동이 답을 말한다. 파산한 항공사의 데이터에 1천만 달러를, 스타트업의 슬랙 메시지에 수십만 달러를 치르는 것은, 랩들이 이미 공개 웹 이후를 준비하고 있다는 가장 정직한 신호다.

[그림 2] 텍스트 데이터의 총량과 데이터 사용량 전망 (출처: epoch.ai)

이 이미지는 2020년부터 2034년까지 공공 텍스트 및 데이터 사용량의 예측을 나타내는 그래프입니다

  • Y축: 유효 스토어(토큰 수)를 10의 11승부터 10의 15승까지 대수 스케일로 표시합니다.
  • X축: 2020년부터 2034년까지의 연도를 나타냅니다.
  • 인간 공공 텍스트 스톡(상단 초록색 선): 완만한 증가세를 보입니다.
  • LLM 학습 데이터셋 크기(하단 파란색 선): GPT-3, PaLM, FLAN 137B, Falcon-180B, DBRX, Llama 3 등을 거치며 가파르게 증가하여 향후 공공 데이터 스톡 수준에 수렴할 것으로 예측됩니다.
  • 주요 시점: 2027년(5배 오버트레이닝 중앙값 날짜)과 2028년(전체 스톡 사용 중앙값 날짜)이 강조되어 있습니다.

가장 값진 데이터는 공개 웹에 없다

마른 것은 양만이 아니다. 질도 다르다. 공개 웹에는 잘 다듬어진 결과물은 넘치지만, 사람이 실제로 문제를 풀어가는 과정은 없다. 한 데이터 검증 기업 대표의 표현대로, 랩들은 인터넷을 다 긁었고 이제 진짜 사람들 사이의 진짜 상호작용을 원한다. 시행착오와 중간 판단, 무언가 잘못됐을 때의 복구가 담긴 날것의 업무 흐름 말이다. AI 직원을 훈련하려면 직원들의 일상 업무 대화로 학습시켜야 한다. 랩들은 이 대화를 다른 사건과 짝지어 모델을 가르친다. 이를테면 사파리에서 로그인이 실패했다는 IT 티켓을, 그 문제를 두고 실행 로그와 함께 엔지니어들이 주고받은 메시지 스레드를 연결해 '문제를 어떻게 푸는가'를 학습시키는 식이다. 이러면 가치가 역전된다. 기업이 지워도 그만이라 여기던 데이터일수록, 오히려 공개 웹에 없는 희소한 실제 노동과 해결의 기록이라 더 값지다. 정제를 마친 원유가 아니라, 땅속에 묻힌 채 방치되던 원유가 이제야 시추 대상이 된 셈이다.

가장 값진 것은 가장 특수한 데이터다

수요는 범용 업무 대화를 넘어 각 산업의 독점 데이터로 번진다. 지난 1년간 헬스케어·에너지·금융 분야의 데이터 세트 수요가 폭증했다. 물류에서 수천 개의 운송사와 화물을 잇는 데이터가 그 사업이 어떻게 맞물려 돌아가는지를 통째로 보여주듯, 특정 산업의 작동 원리를 담은 데이터는 공개 웹으로 대체할 수 없다. 앤트로픽과 오픈AI가 생명과학 같은 산업별 응용을 개발할수록 이 수요는 더 커진다. 이 명제가 국내 대기업에 무엇을 의미하는지는 5장에서 다룬다. 다만 랩들이 원하는 것은 이제 데이터에 그치지 않는다.

3. 정적 데이터에서 강화학습 환경으로

AI 랩이 원하는 것은 이제 데이터가 아니라, 에이전트가 실제로 일을 배우는 '작업장'이다.
다음 단어를 맞히는 방식으로는 대화하는 모델은 만들 수 있어도, 과제를 끝까지 완수하는 에이전트는 만들기 어렵다. 그래서 훈련 방식이 바뀌고 있다. 강화학습은 모델에게 다음 단어가 아니라 과제 전체, 이를테면 코드베이스의 버그를 고치는 일을, 시행착오를 거쳐 완수하도록 가르치고, 검증자(verifier)가 성공 여부를 판정한다. 이 방식에는 세 가지가 필요하다. 에이전트가 일할 환경, 그 안에서 쓸 도구, 그리고 결과를 채점할 검증자다. 여기서 '환경'이란 실제 업무 흐름을 재현한 시뮬레이션 작업장을 뜻한다. Scale AI에 따르면 신규 데이터 훈련 프로젝트의 절반가량이 이미 이런 강화학습 환경이며, 이는 모델 개발의 무게중심이 얼마나 빠르게 옮겨가고 있는지를 보여준다.[5] 이 환경은 실제 기업과 소비자 워크플로우를 본떠 만들어지고, 도메인 전문가가 현실 업무의 모호함과 예외 상황까지 담아 설계한다. 정리하면, 이제 거래되는 것은 데이터 세트가 아니라 하나의 '작동하는 직무 복제본'이다.

데이터 판매에서 역량 이전으로

여기서 수요의 성격이 근본적으로 달라진다. 1, 2장의 요구가 "너의 기록을 달라"였다면, 이제는 "너의 일하는 방식을 재현한 시뮬레이션 환경 안에서 에이전트가 그 일을 배우게 해달라"다. 이것은 더 이상 데이터 판매가 아니라 역량의 이전이다. 누구의 워크플로우를 에이전트에게 훈련시키느냐가, 그 에이전트가 누구를 대체할 수 있느냐를 결정한다. 한 기업이 가격을 매기고, 물량을 배차하고, 계약을 마무리하고, 고객 문제를 해결하는 방식 자체가 훈련 환경이 되는 순간, 그 기업은 데이터 부산물을 현금화하는 데 그치지 않는다. 자기 직무를 그대로 재현할 모델을 스스로 학습시키는 것이다.

새로운 공급망이 산업이 되다

이 환경을 만들어 공급하는 산업은 이미 형성됐다. Mercor, Surge, Handshake 같은 데이터 중개사는 각각 연간 반복 매출(ARR, Annual Recurring Revenue) 10억 달러를 넘어섰고, 생긴 지 1년 남짓한 Fleet, Mechanize, Afterquery 같은 스타트업도 1억 달러 안팎에 이른다.[6] 구매자는 두 진영으로 나뉜다. 지금 가장 강한 수요를 보이는 프론티어 랩, 그리고 점차 자체 환경을 구축하는 기업들이다. 후자의 경우가 5장에서 다룰 텐데 매우 중요하다. 자사의 워크플로우를 훈련 환경으로 바꿀 수 있는 기업은, 그것을 팔지 않고 자기 해자를 더 깊게 파는 데 쓸 수 있기 때문이다. 응답을 더 잘하는 챗봇이 아니라, 그 일을 실제로 해내는 에이전트를 얻기 위해서다. 그러나 이 모든 것은 양날의 검이다. 데이터가 자산이 되는 순간, 그것은 동시에 부채가 된다.

4. 자산인가 부채인가

지워도 그만이던 데이터 배기가스가 새로운 수익원이자 경쟁 입력이 된다. 특히 각 산업의 독점 데이터 수요가 폭발하면서, 헬스케어/에너지/금융처럼 공개 웹으로 대체할 수 없는 기록을 가진 기업은 그 자체로 잠재적 자산의 보고를 쥔 셈이다. 2장에서 이야기한 대로 가장 값진 데이터는 가장 특수한 데이터이고, 수십 년 치 운영 기록을 쌓아둔 기업은, 재무제표에는 잡히지 않지만 실은 값나가는 데이터를 이미 대량으로 보유하고 있다. 그러나 이것은 칼날의 한쪽일 뿐이다.

하지만 같은 데이터가 짊어지는 위험을 생각해 볼 차례다. 첫째는 헐값에 넘겨지는 위험이다. 대형 기술 기업들은 인수 시 1억~3억 달러로 평가될 회사의 데이터를 수백만~1천만 달러의 라이선스로 가져간다. 파는 쪽은 정작 자신이 무엇을 넘기는지 값을 매기지 못한 채 가장 값진 자산을 주고 빈껍데기로 남을 수 있다. 둘째는 프라이버시와 계약, 지식재산의 지뢰밭이다. 데이터 배기가스에는 고객의 개인식별정보, 제3자 약관에 묶인 데이터, 환자 정보처럼 법으로 보호되는 기록이 뒤섞여 있어 그대로 팔 수 없다. 비식별화가 전제되지만 여기엔 근본적으로 조심해야 할 필요가 있다. 너무 많이 지우면 데이터는 쓸모를 잃는다. 셋째는 자기 대체재를 훈련시키는 역설이다. 3장에서 설명했듯 워크플로우 자체가 훈련 환경이 되는 순간, 기업은 자기 직무를 그대로 해낼 모델을 스스로 가르치는 셈이 된다. 넷째는 직원의 동의와 신뢰다. 이 데이터는 결국 직원들의 노동이 남긴 것이다. 메타는 직원 컴퓨터 사용을 모니터링하려다 반발에 부딪혀 중단했고, SpaceX는 직원 데이터가 Grok 학습에 쓰인다고 통보했으며, Spirit의 승무원 노조는 데이터 매각을 "팔려서는 안 될 것을 파는 일"이라 반발했다. 비식별화를 거친다 해도, 떠난 직원들은 자신이 들여다볼 수도 없는 안전장치에 기대야 한다.

네 가지 위험은 모두 하나의 역량으로 해결 가능하다. 우리가 무슨 데이터를 가졌고, 어디서 왔으며, 누가 무엇에 동의했고, 무엇이 제3자 약관에 묶여 있는지를 알고, 쓸모를 지키면서 안전하게 비식별화할 수 있는 능력이다. 그래서 자산의 실체는 데이터 자체가 아니다. 그 데이터가 활용해도 안전함을 증명할 수 있는 능력이 자산이다. 출처와 동의, 비식별화, 지식재산 정리를 갖춘 데이터 거버넌스는 그 자체로 해자가 된다. 이를 증명할 수 있는 기업은 데이터 배기가스를 현금으로 바꾸고, 데이터만 쌓아둔 기업은 부채 위에 앉는다. 그리고 이 문턱은 나라마다 다르다. 국내에서는 개인정보보호법이 그 문턱을 특히 높인다.

5. 국내 환경 – 가진 자가 아니라 증명하는 자

데이터가 아니라 그것을 안전하게 활용할 수 있음을 증명하는 능력이 자산이라는 명제는, 국내에서 원칙을 넘어 법적 문턱으로 굳어진다. 한국 대기업은 데이터의 보고를 쥐고 있지만, 그 문을 여는 열쇠는 보유가 아니라 증명이다.

제조와 물류, 유통, 통신, 금융에서 국내 대기업이 수십 년간 쌓은 운영 데이터는, '가장 값진 것은 가장 특수한 데이터'라는 명제에 딱 맞는다. 공정의 이상 징후를 어떻게 잡아냈는지, 수천 개 화물을 어떻게 배차했는지, 여신을 어떻게 심사했는지가 담긴 기록은 공개 웹 어디에도 없다. 한 번도 장부에 오른 적 없는 이 자산을, 국내 대기업은 이미 보유하고 있다. 문제는 이것이 그대로 현금화되지 않는다는 데 있다. 방향만 보면 규제는 완화되고 있다. 개인정보보호위원회는 2026년 3월 가명정보 처리 가이드라인을 위험도 기반 체계로 전면 개정해 활용의 문을 넓혔고, AI 학습을 위해 적법하게 수집한 개인정보를 사전 심의를 거쳐 활용할 수 있게 하는 특례 개정안도 2026년 5월 국회 정무위를 통과했다.[7] 그러나 문이 열리는 만큼 입증의 책임은 무거워진다. 개정 가이드라인의 핵심은 가명처리를 단순한 기술 조치가 아니라 하나의 거버넌스 체계로 다루라는 것이다. 내부 활용인지 제3자 제공인지, 처리 환경을 통제할 수 있는지, 비정형 데이터가 섞였는지에 따라 검토와 문서화의 수준이 달라진다. 요컨대 규제 완화는 설명 가능한 리스크 관리 체계를 갖춘 기업에만 유리하게 작동한다.

국내 대기업의 과제는 이중적이다. 하나는 밖으로 새어 나가는 위험을 관리하며 데이터를 자산화하는 일이다. 서비스로 수집한 데이터를 애초 고지한 목적과 다른 AI 학습에 재활용하면 목적 외 이용이 된다. 실제로 앱이 수집한 대화를 별도의 AI 챗봇 학습에 사용한 사건에서, 법원은 실질적 동의가 없었다며 위법으로 판단했다. 데이터를 자산으로 바꾸려는 기업이 가장 먼저 넘어야 할 벽이다. 다른 하나는 정반대 방향의 유출이다. 직원이 업무 문서를 외부 생성형 AI에 입력하는 순간, 기업의 기술과 기밀이 남의 모델로 흘러 들어간다. 데이터를 활용하는 능력과 지키는 능력은 결국 같은 거버넌스의 양면이다. 개인정보위가 생성형 AI의 개발·활용 생애주기에 걸쳐 단계별 안전조치를 요구하는 것도 같은 맥락이다. 그렇다면 리더는 무엇을 결정해야 할까.

6. 리더를 위한 선택

공개 웹 데이터가 소진되고, 방치되던 데이터에 값이 매겨지며, 수요가 데이터를 넘어 워크플로우로 옮겨가는 세계에서, 우리 데이터를 어떻게 할 것인가. 선택지는 셋이다. 데이터를 팔 것인가, 활용할 것인가, 지킬 것인가

데이터를 팔 것인가

방치되던 데이터를 라이선싱해 수익으로 바꾸는 것이다. 당장 현금이 되고, 장부에 없던 자산이 드러난다. 그러나 4장에서 언급한 함정이 있다. 값을 제대로 매기지 못한 채 넘기면 값진 자산만 넘겨주고 빈껍데기로 남을 수 있고, 워크플로우가 담긴 데이터일수록 자기 직무를 대체할 역량을 넘기는 셈이 된다. 팔더라도, 무엇을 파는지 스스로 가치를 매길 수 있을 때만 파는 것이 옳다.

활용할 것인가

데이터를 밖으로 팔지 않고, 자사의 강화학습 환경과 도메인 모델을 짓는 데 쓰는 길이다. 곧 자체 환경을 구축하는 기업이 여기에 선다. 남의 모델을 훈련시키는 대신 자기 해자를 더 깊게 파는 것이며, 이는 모델을 둘러싼 층을 직접 쌓는 전략과 정확히 이어진다. 가장 특수한 데이터를 가진 기업에는 이 길이 가장 큰 값을 낳는다. 데이터의 가치가 남의 손에서가 아니라 자기 업무 안에서 실현되기 때문이다.

지킬 것인가

파는 것과 활용하는 것 이전에, 새어 나가지 않게 지키는 일이 먼저다. 서비스로 수집한 데이터를 함부로 재활용하지 않고, 직원이 기밀을 외부 모델에 흘리지 않으며, 출처와 동의와 권리가 불분명한 데이터를 성급히 자산으로 착각하지 않는 것이다. 지키는 능력이 없으면 파는 것도 활용하는 것도 부채가 된다.

사실 세 선택은 별개가 아니다. 무엇을 가졌고 어디서 왔으며 누가 무엇에 동의했는지를 알고, 쓸모를 지키면서 안전하게 비식별화하며, 그 정당성을 설명할 수 있는 데이터 거버넌스, 이 하나의 역량이 세 길 모두의 전제다. 그래서 리더가 지금 던져야 할 질문은 "우리는 어떤 데이터를 가졌는가"가 아니라 그 앞의 세 가지다. 우리가 가진 데이터의 출처와 권리는 명확한가. 무엇이 자산이고 무엇이 부채인가. 우리 직원의 워크플로우가, 우리도 모르는 사이 누군가의 에이전트를 훈련시키고 있지는 않은가.

공개 웹 데이터 시대는 저물고 있다. 누구나 같은 모델을 살 수 있지만, 우리가 회사에서 업무를 하며 남긴 기록은 세상에 하나뿐이다. 그것을 자산으로 키워낼지, 남의 자산으로 흘려보낼지, 아니면 부채로 남길지가 다음 경쟁의 분기점이다. 데이터를 가진 것은 더 이상 우위가 아니다. 그것을 지키고, 키워낼 수 있는 것이 우위를 만든다.

References

  • Forbes, “Google’s ‘Outrageous’ Plan To Train AI Using Spirit Airlines’ Data…”, Aug 18, 2026
  • Axios, “Google wins bankruptcy auction for Spirit Airlines emails, chats, documents”, Aug 17, 2026
  • The Information, “OpenAI, Anthropic Data Demand Turns Startups’ Slack Threads Into Prized Assets”, Aug 13, 2026
  • epoch.ai, “Will we run out of data?”, Jun 6, 2024
  • Scale, “The Next Frontier of Data Training: RL Environments”, Feb 27, 2026
  • SemiAnalysis, “The Future of Meta Superintelligence”, Jul 09, 2026
  • 전국인력신문, “국회 정무위, AI 학습용 개인정보 활용 특례 담은 개인정보보호법 개정안 의결”, May 17, 2026

FAQ

  • 데이터 배기가스(Data Exhaust)란 무엇이며, 왜 AI 시대에 가치가 높아졌나요?

    데이터 배기가스는 사용자의 행동 과정에서 부수적으로 생성되는 흔적 데이터를 의미합니다. 공개된 인터넷 데이터가 고갈되는 상황에서, 정제된 결과물이 아닌 '사람이 실제로 문제를 해결하는 과정과 상호작용'이 담긴 이 데이터가 AI 에이전트를 훈련시키는 가장 희소하고 값진 재료가 되었기 때문입니다.

  • AI 랩들이 단순한 데이터 세트보다 '강화학습 환경'을 더 원하는 이유는 무엇인가요?

    단순히 다음 단어를 예측하는 방식으로는 복잡한 과제를 완수하는 에이전트를 만들기 어렵기 때문입니다. 실제 업무 흐름을 재현한 시뮬레이션 작업장(환경)에서 에이전트가 시행착오를 거쳐 업무를 배우게 함으로써, 단순한 기록의 전달을 넘어 실제 '일하는 방식'과 '역량'을 이전받기 위해서입니다.

  • 기업 데이터를 자산화하는 과정에서 발생할 수 있는 주요 위험 요소는 무엇인가요?

    가치 평가 미흡으로 인한 헐값 매각 위험, 개인정보 및 지식재산권 침해와 같은 법적 리스크, 자사 직무를 대체할 모델을 스스로 훈련시키는 역설, 그리고 데이터 생성 주체인 직원의 동의와 신뢰 부족이라는 네 가지 위험이 존재합니다.

  • AI 시대에 데이터를 단순히 보유하는 것보다 '증명'하는 능력이 더 중요한 이유는 무엇인가요?

    데이터 배기가스에는 개인정보와 기밀이 섞여 있어 그대로 활용할 수 없기 때문입니다. 데이터의 출처, 권리, 동의 여부를 명확히 하고 안전하게 비식별화할 수 있음을 입증하는 '데이터 거버넌스' 체계를 갖춘 기업만이 데이터를 부채가 아닌 실제 자산으로 전환할 수 있습니다.

  • 한국 기업들이 AI 데이터 자산화를 추진할 때 특히 유의해야 할 점은 무엇인가요?

    개인정보보호법이라는 높은 법적 문턱을 넘어야 한다는 점입니다. 규제가 완화되는 추세지만, 가명 처리를 단순한 기술 조치가 아닌 거버넌스 체계로 다루고 리스크 관리 능력을 문서화하여 입증할 수 있는 기업만이 데이터를 안전하게 활용할 수 있습니다.

  • 기업 리더가 데이터 전략을 세울 때 고려해야 할 세 가지 선택지는 무엇인가요?

    첫째는 데이터를 라이선싱하여 수익화하는 '판매', 둘째는 자사의 강화학습 환경과 도메인 모델을 구축해 기업만의 해자를 깊게 파는 '활용', 셋째는 기밀 유출과 법적 리스크를 막아 데이터가 부채가 되지 않게 하는 '보호'입니다.

▶   해당 콘텐츠는 저작권법에 의하여 보호받는 저작물로 기고자에게 저작권이 있습니다.
▶   해당 콘텐츠는 사전 동의 없이 2차 가공 및 영리적인 이용을 금하고 있습니다.


저자

SAP France의 Senior Program Manager 한국에서 컴퓨터 공학을 전공 후, 7년간 한국후지쯔에서 개발자로 근무하고, 1998년 프랑스 파리로 이주하여 Business Objects에서 개발 매니저와 프로그램 매니저를 거쳐, 현재 SAP의 클라우드 ERP 엔지니어링 그룹의 시니어 프로덕트/프로그램 매니저로 근무 중입니다. 책 <프로덕트 매니지먼트>의 저자입니다.

CONTACT US

무엇이든 물어보세요.

AI 도입부터 최적화까지, 맞춤형 솔루션을 제안해 드립니다.

문의하기

공유하기