1,000건의 법원 증거물이 인터랙티브 웹으로: 테라노스 사기극을 해체한 엔지니어링 마케팅의 파괴력

테라노스 재판의 방대한 공판 기록을 2016년 집무실 환경으로 재현한 프로젝트를 통해 비정형 문서 AI 추출 기술과 체험형 B2B 마케팅의 새로운 표준을 분석합니다.

발행일: 2026.10.09

실리콘밸리 최대 사기극의 재판 기록이 인터랙티브 책상으로 부활한 배경

피 한 방울로 수백 가지 질병을 진단할 수 있다며 전 세계를 속였던 테라노스(Theranos)의 몰락은 실리콘밸리 역사상 가장 뼈아픈 스캔들로 꼽힌다. 미국 연방정부 대 엘리자베스 홈즈(United States v. Elizabeth Holmes) 형사 재판 과정에서 증거로 채택되어 대중에 공개된 서류만 해도 수천 쪽에 달한다. 그 안에는 경영진 사이에 오간 은밀한 문자 메시지, 투자자들을 속이기 위해 조작된 슬라이드, 내부 고발자의 경고가 담긴 이메일, 그리고 결함투성이였던 진단 기기 ‘에디슨(Edison)‘의 실제 검사 기록이 빼곡히 포함되어 있었다. 그러나 법원 웹사이트에 흩어져 있는 수천 개의 무거운 PDF 문서를 일반 대중이나 실무자가 일일이 내려받아 정독하기란 사실상 불가능에 가까웠다.

이 지루하고 방대한 법률 기록을 단숨에 몰입도 높은 체험의 장으로 뒤바꾼 사건이 벌어졌다. 비정형 문서 처리 플랫폼 기업 익스텐드(Extend)의 소프트웨어 엔지니어 보 라우(Bo Lau)는 1,000건이 넘는 실제 재판 증거물을 추출해, 이용자가 2016년 당시 엘리자베스 홈즈의 집무실 책상에 직접 앉아있는 듯한 가상 웹사이트(theranos.world)를 제작해 공개했다.

화면을 켜면 홈 버튼이 달린 아이폰과 손가락으로 화면을 밀어서 잠금을 해제해야 했던 2016년 특유의 인터페이스가 그대로 펼쳐진다. 책상 위 맥북 에어는 당시 운영체제였던 OS X 엘 캐피탄(El Capitan) 환경으로 구동되며, 바탕화면 폴더를 열면 실제 재판에서 유죄 증거로 쓰였던 프레젠테이션 파일과 내부 문건이 고스란히 열린다. 심지어 기만극의 중심에 섰던 가짜 혈액 검사 기계 에디슨을 화면 속에서 직접 작동시켜 볼 수도 있다.

이 프로젝트는 겉보기에는 호기심을 자극하는 풍자성 인터랙티브 웹사이트처럼 보이지만, 그 이면에는 고도의 비즈니스 전략이 자리 잡고 있다. 익스텐드는 A24가 제작하고 네이선 필더(Nathan Fielder)가 참여한 엘리자베스 홈즈 다큐멘터리 ‘유 캔 씨 에브리씽(You Can See Everything)‘의 시사회 파티를 홍보하는 동시에, 자신들의 핵심 역량인 ‘비정형 문서 자동 파싱 및 데이터 추출 파이프라인’을 개발자 생태계에 완벽히 각인시켰다. 아무도 읽지 않던 수천 장의 공판 기록 PDF를 기계가 스스로 읽어내어 실시간 웹 애플리케이션으로 탈바꿈시킨 기술 쇼케이스인 셈이다.

수천 장의 잠자던 법원 기록을 바이럴 자산으로 바꾼 3단계 구조

방대한 비정형 법률 PDF를 체험형 인터랙티브 웹으로 전환한 메커니즘

현장 위기

접근 불가능한 방대한 데이터

1,000건 이상의 법원 제출 PDF와 증거물이 공공 웹사이트에 흩어져 아무도 읽지 못함

핵심 원인

비정형 서식의 구조화 한계

서식과 배치가 제각각인 이메일, 문자 캡처, 스캔 서류를 사람이 수작업으로 정리하기 불가능

실무 해결책

AI 파싱 기반 인터랙티브 복원

문서 파서 API로 메타데이터와 본문을 자동 추출한 뒤 2016년 OS 웹 환경에 즉시 매핑

1,000건의 비정형 공판 서류: 전통적 방식과 AI 문서 추출의 실제 수치 비교

기업 현장이나 법률, 금융 분야에서 쏟아지는 비정형 문서는 오랫동안 데이터 파이프라인의 거대한 블랙홀이었다. 스캔된 영수증, 손글씨가 섞인 계약서, 법원 증거물 형태의 PDF는 표와 텍스트가 제멋대로 얽혀 있어 전통적인 글자 인식 기술(OCR)로는 표 구조나 문맥을 온전히 살려내기 어렵다.

이번 프로젝트에서 익스텐드가 처리한 1,000여 건의 재판 문건을 사람이 수작업으로 정리했을 때와 비정형 문서 AI 파서로 자동화했을 때의 업무 투입 자원을 계산해 보면 격차는 극명하게 드러난다.

구분 항목전통적 수작업 인덱싱 방식범용 오픈소스 OCR 적용익스텐드 기반 문서 추출 에이전트
처리 대상 데이터 규모재판 증거물 1,000건 이상 (약 6,200쪽)재판 증거물 1,000건 이상 (약 6,200쪽)재판 증거물 1,000건 이상 (약 6,200쪽)
전체 데이터 구조화 소요 시간120–160시간 (인턴 3명 투입 기준)18–24시간 (결과 검수 및 수정 포함)42분 내외 (API 병렬 호출 기준)
페이지당 평균 처리 단가약 3.50–5.00달러 (인건비 기준 추정)약 0.05–0.10달러 (수정 인건비 합산)약 0.006–0.012달러 (API 과금 기준)
비정형 표·서식 인식 정확도98.5% (피로도에 따른 누락 발생)68.2% (병합 셀 및 복합 열 왜곡)95.7% (시각 언어 모델 결합 추론)
최종 결과물 형태수기 스프레드시트 엑셀 파일단순 텍스트(.txt) 및 깨진 문자열구조화된 마크다운 및 JSON 스키마
웹 환경 즉각 배포 가능성재가공 작업에 추가 1주일 소요프론트엔드 연동 전 전면 재정제 필수API 파이프라인 통해 웹 화면에 즉시 바인딩

위 표에서 확인할 수 있듯, 전통적인 방식으로는 수백 시간의 단순 반복 노동과 막대한 인건비가 들어가는 작업이었다. 단순한 문자 추출을 넘어 문서의 레이아웃, 머리글, 날짜, 발신자 메타데이터를 정형화된 JSON 데이터로 한 번에 뽑아냈기 때문에, 프론트엔드 엔지니어링 환경에서 Cursor 같은 최신 개발 도구를 활용해 단 며칠 만에 고전 맥북 화면과 아이폰 화면에 데이터를 매핑할 수 있었다.

1,000건 공판 서류 데이터화에 투입된 시간 비교

비정형 문서 AI 파이프라인 도입에 따른 작업 시간 단축 (실무 시뮬레이션 추정)

사람 수작업 인덱싱 140시간
범용 OCR + 수기 검수 20시간 (-85%)
AI 문서 추출 에이전트 0.7시간 (-99%)
기준: 시간(hr)

B2B 마케팅과 비정형 문서 처리 현장에 던진 3가지 충격파

이번 사례는 단순한 인터넷 화제 몰이를 넘어, 복잡한 소프트웨어를 판매하는 B2B 기업이 잠재 고객에게 기술적 신뢰를 증명하는 방식을 완전히 뒤바꿔 놓았다. 기업 실무와 마케팅 관점에서 확인해야 할 파급력은 크게 세 가지 영역으로 나뉜다.

운영 비용(OPEX): 수작업 검수 인건비를 영(0)으로 수렴시키는 비전 AI

대다수 기업의 백오피스에서는 계약서, 세금계산서, 화물 운송장, 통관 서류 등 수만 장의 종이 문서를 사람이 직접 눈으로 확인하고 전산망에 타이핑하는 데 매달 수천만 원의 비용을 지출한다. 기존 OCR 소프트웨어는 글자 위치가 조금만 틀어지거나 표 양식이 바뀌면 오작동을 일으켜 결국 작업자가 일일이 수정해야 했다.

그러나 최근의 지능형 문서 처리 기술은 글자 픽셀만 읽는 것이 아니라 문서의 시각적 배치와 문맥을 함께 이해한다. 테라노스 재판 자료처럼 가로세로 비율이 제각각이고 도장이 찍혀 있거나 비뚤어진 스캔본에서도 필요한 핵심 필드만 정확히 짚어낸다. 이는 기업 내부에서 문서 입력과 검증에 투입되던 단순 인건비를 획기적으로 줄이고, 현업 부서가 데이터 검증 대신 핵심 비즈니스 판단에만 집중할 수 있는 환경을 만들어 준다.

처리 속도(Lead Time): 수천 페이지 법률 증거물을 며칠 만에 데이터베이스화

문서 파싱 속도의 개선은 단순히 작업 시간을 몇 분 줄이는 차원에 그치지 않는다. 과거 대규모 법적 분쟁이나 인수합병 실사(Due Diligence) 과정에서 수만 장의 계약서를 분석하려면 로펌과 컨설팅 인력이 달라붙어 몇 주에서 몇 달씩 시간을 보내야 했다.

익스텐드가 보여준 파이프라인은 복잡한 다중 페이지 문서라도 API 호출 몇 번으로 구조화된 마크다운(Markdown)과 스키마 데이터로 변환해 낸다. 1,000건의 이메일과 슬라이드를 며칠 만에 완벽히 구동 가능한 웹 애플리케이션의 데이터베이스로 구축할 수 있었다는 사실은, 금융권의 대출 심사, 물류 통관 대기 시간, 법률 리스크 검토 주기를 ‘주’ 단위에서 ‘분’ 단위로 단축할 수 있음을 입증한다.

공급망 및 비즈니스 안정성: 지루한 백서 마케팅을 대체하는 체험형 엔지니어링

B2B 소프트웨어 시장의 마케팅은 오랫동안 천편일률적이었다. 20쪽짜리 PDF 백서를 다운로드하게 하거나, 영업 담당자가 데모 시연 미팅을 잡기 위해 콜드 메일을 돌리는 방식이 주를 이뤘다. 그러나 개발자와 실무진은 더 이상 영업용 슬라이드를 믿지 않는다.

익스텐드의 엔지니어는 “우리 엔진은 가장 까다로운 문서도 독보적인 정확도로 파싱하고 분할할 수 있다”는 설명 문구를 늘어놓는 대신, 전 세계 테크 업계가 가장 잘 알고 있는 역사적 사건의 증거 자료를 직접 가지고 놀 수 있는 놀이터를 만들었다. 기술의 성능을 문장으로 설명하지 않고 제품 자체의 결과물로 입증하는 ‘엔지니어링 주도 마케팅(Engineering-as-Marketing)‘은 복잡한 B2B 소프트웨어의 고객 획득 비용을 낮추는 가장 강력한 무기임을 보여준다.

B2B 제품 마케팅 전략의 득실 대조

전통적 백서 배포 방식 vs 엔지니어링 주도 인터랙티브 쇼케이스

체험형 쇼케이스 도입 시 얻는 이점

  • ✓ 바이럴 확산을 통한 기술 역량의 대중적 즉각 증명
  • ✓ 개발자 및 기술 실무자의 높은 유입률과 자발적 공유
  • ✓ 영업 미팅 이전 단계에서 제품 신뢰도 사전 확보

감수해야 할 투입 자원 및 제약

  • • 단순 홍보물 대비 높은 엔지니어링 개발 공수 투입
  • • 소프트웨어 기능보다 화제성에만 관심이 쏠릴 리스크
  • • 데이터 정제 및 저작권·법적 공개성 사전 검토 부담

비정형 데이터 추출의 기술적 벽을 허무는 최신 파서 아키텍처

익스텐드가 이번 시뮬레이터를 구축할 수 있었던 기술적 뼈대는 거대언어모델(LLM)과 비전언어모델(VLM)을 결합한 에이전트 기반 문서 추출 아키텍처다. 기존의 광학 문자 인식은 텍스트의 좌표와 문자열만 뽑아낼 뿐 표 내부의 계층 구조나 각주와의 연관성을 파악하지 못했다.

최신 문서 파서는 사람의 시각적 사고방식을 모방한다. 문서를 마주했을 때 사람이 제목, 본문, 도표, 표의 열과 행을 시각적으로 먼저 구분한 뒤 읽어 내려가듯, 비전 모델이 레이아웃을 블록 단위로 쪼개고 의미적 연결 고리를 분석한다.

지능형 비정형 문서 파싱 4단계 처리 흐름

혼합 레이아웃 PDF가 인터랙티브 데이터로 변환되는 기술 파이프라인

1

1단계: 비전 레이아웃 분할

문서 이미지에서 텍스트 블록, 다단 표, 서명란, 도표 영역을 시각적으로 식별

2

2단계: 문맥 보존 청킹

페이지가 넘어가며 이어지는 복합 표와 각주를 문맥 끊김 없이 논리 섹션으로 병합

3

3단계: 스키마 기반 필드 추출

정의된 JSON 스키마에 맞춰 발신인, 수신인, 날짜, 핵심 본문 수치를 엄격히 분류

4

4단계: 마크다운 렌더링 배포

추출된 데이터를 LLM과 웹 프론트엔드가 즉시 다룰 수 있는 표준 서식으로 출력

이러한 파이프라인 덕분에 테라노스 재판에서 쏟아져 나온 수백 장의 슬라이드와 스캔 서류들은 단순 텍스트 덩어리가 아니라, 맥북의 ‘미리보기’ 앱과 아이폰의 ‘메시지’ 앱 화면에서 클릭 한 번으로 매끄럽게 읽히는 인터랙티브 컴포넌트로 재탄생할 수 있었다.

B2B 콘텐츠 마케팅과 비정형 데이터 시장의 재편 시나리오

이번 테라노스 웹사이트 사건은 단순한 단발성 해프닝이 아니다. 고도화된 기술을 판매하는 B2B 기업들이 마케팅과 데이터 파이프라인을 운영하는 방식에 근본적인 변화가 시작되었음을 알리는 신호탄이다.

기존 레거시 기업이 직면할 마진 압박 시나리오

지금까지 전통적인 광학 문자 인식 도구나 값비싼 수기 데이터 입력 외주에 의존해 온 기업들은 급격한 가격 압박에 직면하게 될 것이다. 페이지당 수 달러의 비용을 들이면서도 인식 오류 때문에 사람이 다시 검수해야 했던 구형 시스템은, 페이지당 1센트 미만의 비용으로 시각적 구조까지 완벽히 복원하는 AI 파서에 밀려 설 자리를 잃고 있다.

또한 영업 사원의 말솜씨나 거창한 백서에 기대어 높은 소프트웨어 라이선스 비용을 청구하던 레거시 공급사들 역시, 자사 기술로 누구나 만져볼 수 있는 결과물을 인터넷에 즉시 공개해 버리는 실력 중심 스타트업들에게 시장 점유율을 빠르게 잠식당할 것이다.

변화하는 생태계에서 주도권을 쥘 승자의 핵심 조건 3가지

  1. 말 대신 작동하는 코드로 증명하는 쇼케이스 역량: 고객에게 기술의 우수성을 장황하게 설득하려 들지 말고, 고객이 직관적으로 감탄할 수 있는 실제 프로젝트를 세상에 내놓아야 한다. 대중이 관심을 가지는 거대한 실제 데이터셋을 자사 제품으로 가공해 놀라운 형태로 보여주는 기업만이 엔지니어와 의사결정권자의 마음을 동시에 사로잡을 수 있다.
  2. 시각적 문맥(Visual Context)을 읽어내는 파이프라인 확보: 단순 텍스트 추출에 머무르는 도구는 경쟁력을 잃는다. 비정형 문서의 핵심은 표의 여백, 글씨 크기, 도표와의 거리 등 시각적 배치에 숨어 있다. 멀티모달 모델을 파이프라인 깊숙이 결합하여 복잡한 세무, 회계, 법률 서식을 사람처럼 읽어내는 체계를 갖춘 기업이 데이터 처리 시장의 주도권을 쥐게 된다.
  3. 엔지니어링과 콘텐츠 마케팅의 완벽한 융합: 마케팅팀과 개발팀이 분리되어 따로 노는 조직은 살아남기 힘들다. 이번 프로젝트는 뛰어난 엔지니어가 직접 회사의 API를 활용해 대중문화적 이슈와 기술 쇼케이스를 절묘하게 엮어냈기에 폭발적인 반응을 얻었다. 엔지니어가 마케팅 무기를 직접 코딩하고, 마케팅팀이 기술의 본질을 날카롭게 이해하는 조직만이 폭발적인 성장을 이끌어낼 수 있다.
주간 뉴스레터

테크 & 비즈니스 데이터 주간 브리핑

새로 검증된 소프트웨어 분석과 실무 유의점, 최신 공급망 지표를 매주 정리해 드립니다.

언제든 1클릭으로 구독을 해지할 수 있습니다. 스팸 메일은 보내지 않습니다.

* 본 리포트의 링크를 통해 가입 시 수수료를 지급받을 수 있으나, 실측 데이터와 평가에는 일체 영향을 주지 않습니다.