2025년 5월, 미국 뉴욕 남부 연방지방법원의 오나 왕(Ona Wang) 치안판사는 OpenAI에 모든 ChatGPT 대화 내용을 무기한 보존하라고 명령했습니다. 여기에는 임시 채팅(temporary chats), 사용자가 삭제한 대화, 그리고 기업 고객들에게 절대 저장되지 않는다고 안내했던 API 트래픽까지 포함되었습니다. 이 명령은 “법원의 추가 명령이 있을 때까지” 효력을 유지합니다.

OpenAI의 COO 브래드 라이트캡(Brad Lightcap)은 AI 도입을 검토 중인 모든 기업이 주목해야 할 한 문장으로 이에 대응했습니다.

“당사의 제로 데이터 보존(Zero Data Retention, ZDR) API를 사용하는 비즈니스 고객의 경우, 당사는 귀하가 전송한 프롬프트나 당사가 반환한 답변을 절대 보존하지 않습니다. 데이터가 저장되지 않기 때문에 이번 법원 명령은 해당 데이터에 영향을 미치지 않습니다.”

이 한 문장은 ZDR이 단순한 마케팅용 체크박스가 아님을 보여주는 가장 강력한 현실적 증거입니다. 귀사의 데이터가 서버에 남아 법원 명령, 소환장(subpoenas), 디스커버리(증거개시, discovery) 요구의 대상이 되는 것과, 데이터가 아예 존재하지 않는 것 사이의 결정적인 차이를 만들기 때문입니다.

그럼에도 불구하고 ZDR에 대한 가장 흔한 반론은 여전히 남아 있습니다. “제공업체가 내 데이터를 보관할 수 없다면 모델이 나로부터 학습하지 못할 텐데, 그러면 ROI가 떨어지지 않나요?”

결론부터 말씀드리면 그렇지 않습니다. 그리고 이러한 반론의 이면에는 프론티어 LLM이 작동하는 방식에 대한 근본적인 오해가 자리 잡고 있습니다.


오해: 학습(Training) vs. 추론(Inference)

이러한 의구심을 품는 직관 자체는 자연스럽습니다. LLM이 똑똑해지려면 데이터가 필요하고, 데이터의 유입을 제한하면 모델 성능이 저하될 것이라고 생각하기 쉽습니다.

하지만 이는 수개월의 시간차와 수천 마일의 공간적 격차를 두고 발생하는 완전히 다른 두 가지 연산을 혼동한 결과입니다.

**학습(Training)**은 신경망에 수십억 개의 문서를 입력하여 가중치(weights)를 조정하는, 수개월에 걸쳐 수백만 달러가 투입되는 대규모 연산 과정입니다. 이 과정을 거쳐 GPT-5, Claude Opus, Gemini Ultra와 같은 기본 모델(Base model)이 완성됩니다. 학습이 완료되면 모델의 가중치는 완전히 동결(freeze)됩니다.

**추론(Inference)**은 프롬프트를 전송할 때 발생하는 연산입니다. 모델은 입력값을 읽고 기존 가중치를 기반으로 수학적으로 가장 확률이 높은 다음 토큰을 계산하여 응답을 반환합니다. 이 과정에서 가중치는 결코 변하지 않습니다. 모델은 귀하의 API 호출로부터 “학습”하지 않습니다. 귀하의 피드백, 선호도, 독점 데이터를 바탕으로 스스로를 업데이트하지 않는다는 의미입니다.

ZDR은 오직 추론이 끝난 이후에 일어나는 일, 즉 제공업체가 귀하의 프롬프트와 생성된 응답의 사본을 저장할지 여부만을 결정합니다. 추론 과정에서 발휘되는 모델의 지능에는 전혀 영향을 미치지 않습니다.

따라서 ZDR을 켜든 끄든 모델의 역량은 완전히 동일합니다. 동일한 가중치, 동일한 레이턴시, 동일한 품질을 유지합니다.


ZDR이 실제로 의미하는 것

제로 데이터 보존(Zero Data Retention)은 단일하고 표준화된 보증이 아닙니다. 제공업체마다 상이한 계약적·기술적 합의에 가깝습니다. 하지만 핵심적인 약속은 일관됩니다.

귀하의 프롬프트와 출력값은 추론이 진행되는 동안 휘발성 메모리(RAM)에서만 처리되며, 처리가 끝나는 즉시 폐기됩니다. 로그도, 데이터베이스도, 학습 파이프라인도, 인간 검토 대기열(human review queues)도 거치지 않습니다.

이는 대부분의 제공업체가 기본적으로 제공하는 정책과 근본적으로 다릅니다.

보증 수준 (Guarantee) 실제 의미 (What It Means) 포함되지 않는 것 (What It Does NOT Mean)
학습 미사용 (No Training) 제공업체가 모델 개선에 고객 데이터를 사용하지 않음 “어뷰징 모니터링(abuse monitoring)“을 위해 30일 동안 데이터를 보관할 수 있음
제로 데이터 보존 (Zero Data Retention) API 호출 완료 후 제공업체가 고객 데이터를 전혀 저장하지 않음 완전한 데이터 무영구화(True zero persistence) — 현존하는 가장 강력한 보증

대부분의 제공업체는 엔터프라이즈 및 API 티어에서 기본적으로 “학습 미사용(No Training)“을 제공합니다. 하지만 이는 ZDR이 아닙니다. OpenAI는 API 데이터를 30일간 보관합니다. Anthropic은 API 데이터를 7일간 보관합니다. Google은 Vertex AI 데이터를 30일간 보관합니다. 정식으로 협상된 ZDR 계약만이 이러한 보안 공백을 완전히 메울 수 있습니다.


2026년 기준 3단계 데이터 보존 수준

현재 엔터프라이즈 AI 시장의 데이터 보존 정책은 세 가지 단계로 계층화되어 있습니다.

레벨 저장되는 데이터 대표적인 사용 사례
표준 보존 (Standard Retention) 프롬프트 및 출력값을 30일 이상 보관 무료 티어 사용자, 개인 개발자
어뷰징 모니터링 (Abuse Monitoring) 메타데이터 및 안전 점수를 최대 2년간 보관, 콘텐츠 본문은 7~30일 후 삭제 대부분의 상용 API 티어 기본값
진정한 제로 데이터 보존 (True Zero Data Retention) 영구 저장소 보관 전무(0), RAM 전용 추론 엔터프라이즈, 헬스케어(HIPAA), 공공/정부

이 구분을 명확히 파악하는 것이 중요합니다. “귀사의 데이터로 모델을 학습시키지 않습니다”는 레벨 2입니다. “귀사의 데이터를 아예 저장하지 않습니다”가 바로 레벨 3입니다. 하지만 많은 제공업체가 레벨 2를 마치 레벨 3인 것처럼 마케팅하고 있습니다.


제공업체별 현황: 누가 무엇을 제공하는가

OpenAI

표준 API는 신뢰 및 안전(trust and safety) 모니터링을 위해 입력값과 출력값을 30일 동안 보관합니다. 기본적으로 모델 학습에는 사용되지 않습니다. ZDR은 자격을 갖춘 엔터프라이즈 고객에 한해 별도의 심사 신청 절차를 거쳐 제공됩니다.

ZDR이 활성화되면 OpenAI는 지원 대상 엔드포인트 전체에 강제로 store=false를 적용하고, 어뷰징 모니터링 로그에서 데이터를 제외하며, 일체의 인간 검토를 허용하지 않습니다. 일반 소비자용 ChatGPT(Free, Plus, Team)는 어떠한 경우에도 ZDR을 제공하지 않습니다.

2025년 5월의 법원 보존 명령은 데이터가 디스크에 전혀 기록되지 않았던 ZDR 고객들에게는 아무런 영향을 미치지 않았습니다. 반면 일반 소비자 및 표준 API 사용자들은 운이 따르지 않았습니다. 2025년 4월부터 9월까지의 대화 기록이 현재 진행 중인 소송으로 인해 보안 저장소에 고스란히 남아있기 때문입니다.

Anthropic (Claude)

Anthropic은 기본적으로 API 데이터를 학습에 사용하지 않으며, 이는 OpenAI의 일반 소비자용 제품보다 훨씬 엄격한 기준입니다. 기본 API 보존 기간도 7일에 불과하여 주요 대형 제공업체 중 가장 짧습니다.

ZDR은 영업 담당자와의 별도 계약을 통해 조직(organization) 단위로 활성화할 수 있습니다. 상용 조직 API 키로 사용할 경우 Messages API, Token Counting API, Claude Code에 적용됩니다.

ZDR이 적용되지 않는 영역을 아는 것은 적용되는 영역을 아는 것만큼이나 중요합니다.

  • 콘솔(Console) 및 워크벤치(Workbench) — 지원 대상 제외
  • Claude Managed Agents — 상태 유지(stateful) 특성상 세션 기록(transcripts)이 보존됨
  • 소비자용 제품(Free, Pro, Max) — 지원 대상 제외
  • Claude Fable 5 및 Mythos 5 — 이 모델들은 30일 보존이 필수적이므로 ZDR과 호환되지 않음
  • 플래그(Flag) 지정 콘텐츠 — ZDR이 적용되더라도 Anthropic의 자동화된 신뢰 및 안전 시스템에 의해 플래그가 지정된 입력 및 출력은 최대 2년 동안 보관될 수 있음

마지막 항목은 매우 중요하면서도 간과하기 쉬운 부분입니다. 전송한 콘텐츠가 안전 분류기(safety classifier)에 걸리는 경우 ZDR이 적용되지 않을 수 있습니다.

Google (Gemini / Vertex AI)

Google의 일반 소비자 티어는 세 곳 중 가장 공격적인 보존 정책을 취하고 있습니다. 일상적인 인간 검토와 함께 대화 내용이 최대 3년간 보관됩니다. 반면 Vertex AI는 고객 데이터로 학습하지 않으며 기본적으로 30일간 로그를 보관합니다. ZDR을 구현하려면 엔터프라이즈 GCP 계약을 통해 로깅 및 컨텍스트 캐싱(context caching)을 비활성화해야 합니다.

AWS Bedrock 및 Azure OpenAI

두 플랫폼 모두 기저 모델 제공업체로 트래픽을 전달하지만, 플랫폼 자체적으로는 데이터 무보존을 계약상 약정합니다. AWS Bedrock은 호출 로깅(invocation logging) 모드를 none으로 설정하고 서비스 제어 정책(SCP)을 통해 이를 잠금으로써 ZDR을 지원합니다. Azure는 제한적 접근(Limited Access) 프로그램을 통해 “수정된 어뷰징 모니터링(Modified Abuse Monitoring)“을 제공합니다.

새롭게 부상하는 유럽 제공업체들

현재 몇몇 유럽 제공업체들은 기본 설정으로 ZDR을 제공하고 있습니다.

  • OVHcloud AI Endpoints — 임시 저장조차 없는 계약상 ZDR을 보장합니다. 오픈 가중치(open-weight) 모델 전용이며, 유럽 소버린(sovereign) 호스팅을 지원합니다.
  • Mistral La Plateforme — Scale 플랜에서 상태 비저장(stateless) API 호출에 한해 ZDR을 제공합니다. 에이전트, 배치 처리, 파일, 대화 기록 또는 Vibe Work에는 적용되지 않습니다. 기본적으로 EU 리전을 사용합니다.
  • Regolo.ai — ZDR을 기본 정책으로 채택하고 있습니다. 이탈리아 데이터 센터를 기반으로 오픈 가중치 모델을 서비스합니다.

ZDR이 ROI를 낮추지 않고 오히려 높이는 이유

모델 자체의 역량과 제공업체의 데이터 취급 관행을 분리해서 바라보면 ROI에 대한 논리는 매우 명확해집니다.

1. 규제 대상 사용 사례의 도입 장벽 해제

ZDR이 없다면 수많은 기업들이 프론티어 LLM을 법적으로 도입할 수 없습니다. 미국 건강보험양도증명법(HIPAA)은 데이터를 보존하는 제공업체에 개인건강정보(PHI)를 전송하는 것을 금지합니다. 유럽 일반개인정보보호법(GDPR) 제5조 제1항 (e)호는 필요한 기간을 초과하여 데이터를 저장하는 것을 금합니다. 기업의 데이터 처리 계약(DPA) 검토 과정에서도 표준 30일 보존 정책은 번번이 거부당합니다.

컴플라이언스 이슈로 인해 배포 자체가 가로막힌다면 ROI는 0입니다. ZDR은 이러한 근본적인 걸림돌을 제거합니다.

2. 더 완전하고 가치 있는 데이터 주입 가능

ZDR이 없으면 대부분의 기업은 LLM에 프롬프트를 보내기 전에 개인식별정보(PII), 건강정보(PHI), 소스 코드, 고객 기록 등을 마스킹(비식별화) 처리합니다. 과도하게 마스킹된 프롬프트는 답변의 품질을 떨어뜨립니다. 반면 ZDR이 보장되면 법무팀의 승인 하에 마스킹되지 않은 원본 데이터를 온전히 전달할 수 있어, 모델이 특정 업무에서 본래의 역량을 온전히 발휘할 수 있게 됩니다.

결과물의 품질은 떨어지기는커녕 오히려 향상됩니다.

3. 치명적인 보안 위험 감소

데이터 유출 사고로 인한 평균 피해액은 445만 달러에 달합니다(IBM, 2023). 규제 산업에서는 건강정보(PHI), 개인정보(PII), 영업 비밀이 연루된 단 한 번의 컴플라이언스 위반만으로도 막대한 규제 과징금, 감사 불합격, 고객사 계약 해지, 평판 훼손 등 상상 이상의 피해를 입을 수 있습니다. ZDR은 제공업체 측에 저장되는 공격 표면(attack surface) 자체를 원천 차단합니다.

4. 법원 명령으로부터의 보호

뉴욕타임스(New York Times) 대 OpenAI 소송은 기업 자체의 데이터 보존 약정조차도 법원의 보존 명령 앞에서는 무력화될 수 있음을 증명했습니다. 일반 소비자용 ChatGPT 데이터와 표준 API 데이터는 현재 무기한 보존 대상이 되었습니다. 오직 ZDR 고객들만이 데이터가 애초에 저장된 적이 없었기 때문에 명시적으로 예외 처리되었습니다.

5. 귀사의 데이터 없이도 모델은 스스로 발전함

프론티어 AI 연구소들은 연구 혁신, 합성 데이터 생성, 강화학습, 추론 최적화, 전문가 제작 데이터셋 등을 통해 모델을 개선합니다. DeepSeek R1 논문은 검증 가능한 보상을 결합한 강화학습만으로 약 29만 4천 달러의 컴퓨팅 비용을 들여 뛰어난 추론 능력을 도출할 수 있음을 입증했습니다. 귀사의 개별 API 호출 데이터는 프론티어 모델 학습 규모 전체로 보면 반올림 오차 수준에 불과합니다.


ZDR이 오히려 ROI를 낮출 수 있는 예외적인 경우

ZDR 도입으로 인해 제약이 발생하는 경우는 정확히 세 가지 시나리오뿐입니다.

제공업체 측의 디버깅이 필요한 경우: ZDR 환경에서는 제공업체가 서버 로그에서 귀하의 요청 ID(Request ID)를 조회할 수 없습니다. 따라서 자체적인 요청 로깅 시스템을 직접 구축하고 관리해야 합니다.

상태 유지(Stateful) 기능에 의존하는 경우: OpenAI의 Responses API 히스토리, 대화 메모리 기능, store=true 설정 기반 프롬프트 캐싱 등은 모두 서버 측 데이터 저장을 필요로 합니다. ZDR은 이러한 기능들을 강제로 비활성화합니다.

제공업체가 귀사의 트래픽을 학습하기를 원하는 경우: 모든 사용자를 위해 기본 모델을 개선하는 데 귀사의 데이터를 기여하고자 한다면, ZDR은 설계상 이를 차단합니다. 이는 별도의 명시적 동의(opt-in) 절차를 거치는 독립적인 프로그램입니다.

이 세 가지에 해당하지 않는다면 — 대부분의 엔터프라이즈 환경은 해당되지 않습니다 — ZDR은 유의미한 단점 없이 실질적인 이점만을 제공합니다.


ZDR을 실현하는 엔터프라이즈 아키텍처

ZDR이 모델에게 처리할 데이터를 주지 않는다는 뜻은 아닙니다. 처리가 끝난 후 모델이 귀하의 데이터를 보관하지 않는다는 의미일 뿐입니다. 데이터는 여전히 추론 과정으로 유입되어 처리되며, 단지 영구 저장되지 않을 뿐입니다.

올바른 엔터프라이즈 아키텍처는 ZDR을 내부 학습 인프라와 결합하는 방식입니다.

Internal Documents (CRM, ERP, SOPs, Batch Records)
                    │
                    ▼
            RAG / Knowledge Graph
                    │
                    ▼
          AI Gateway (ZDR Enabled)
                    │
                    ▼
   Frontier Model (Inference Only)
                    │
                    ▼
            Response Returned
                    │
      Provider Does NOT Retain Data
                    │
                    ▼
     Internal Telemetry & Evaluations
                    │
                    ▼
     Your Company Continuously Improves

프론티어 모델은 순수한 추론 엔진으로 동작합니다. RAG 튜닝, 평가 프레임워크, 정제된 데이터셋, 인간 검토 체계, 지식 그래프와 같은 학습 시스템은 모두 기업 내부에 위치합니다. 모든 상호작용은 제공업체의 시스템이 아니라 귀사의 시스템을 지속적으로 개선합니다.

진정한 ROI가 복리로 누적되는 지점이 바로 여기입니다. 제공업체가 귀사의 프롬프트로 모델을 학습해서가 아니라, 귀사의 조직이 모델 주변에 고유한 제도적 지능(institutional intelligence)을 구축해 나가기 때문에 가치가 상승하는 것입니다.


2026년 ZDR 평가 체크리스트

ZDR 도입을 검토할 때에는 다음 항목들을 빠짐없이 확인해야 합니다.

  • 서명된 정식 계약서 — 단순한 마케팅 문구가 아닌, 서명된 공식 ZDR 계약 체결 여부
  • 영구 로깅 부재 — 30일간의 “안전 점검” 유예 기간 등이 존재하지 않는지 확인
  • RAM 전용 추론 — 데이터가 물리적 디스크에 절대 기록되지 않는지 확인
  • 안전 메타데이터 미보존 — 프롬프트에 대한 안전 분류(classification) 신호를 제공업체가 별도로 저장하지 않는지 확인
  • 계약상 손해배상 면책 및 보증(Contractual indemnity) — 제공업체 서버에서 데이터가 발견될 경우 제공업체가 법적 책임을 부담하는지 여부
  • SOC 2 Type II 또는 ISO 27001 — 데이터 보존 정책을 검증하는 독립적인 제3자 감사 인증 보유 여부
  • 기능별 적용 대상 범위 — 구체적으로 어떤 API 엔드포인트와 기능에 ZDR이 적용되는지 명시 여부
  • 플래그(Flag) 지정 콘텐츠 처리 정책 — 자동화된 안전 시스템에 의해 콘텐츠가 플래그 지정되었을 때 어떻게 처리되는지 확인
  • 데이터 주권 및 보존 지역(Data Residency) — 추론이 실행되는 물리적 위치와 관할 관할권 확인
  • 주변 시스템 연계 — 기업 자체 관측성(observability) 도구, 벡터 저장소, RAG 시스템, 세션 로그 아카이브도 동일하게 무보존 원칙을 준수하는지 점검

마지막 항목은 대부분의 팀들이 가장 쉽게 놓치는 부분입니다. 자체 Langfuse 인스턴스, CloudWatch 로그, 또는 사내 벡터 데이터베이스가 모든 프롬프트를 무기한 보존하고 있다면, 모델 제공업체 수준에서 보장하는 ZDR은 아무런 의미가 없습니다.


결론 (The Bottom Line)

ZDR은 결코 모델의 지능을 떨어뜨리지 않습니다. 이것이 가장 핵심적인 오해이며, 거의 모든 조직이 초기에 이를 정반대로 잘못 이해하곤 합니다.

ZDR은 데이터의 ’미사용(zero use)’이 아니라 ’무보존(zero retention)’을 의미합니다. 모델은 여전히 귀하의 프롬프트를 읽고, 최대의 성능을 발휘하여 이를 처리하며, 완전한 응답을 생성합니다. 단지 연산이 끝난 후 사본을 보관하지 않을 뿐입니다.

헬스케어, 금융, 법률, 생명과학과 같은 규제 산업에서 ZDR은 ’있으면 좋은 부가 기능’이 아닙니다. 엔터프라이즈 AI 배포를 법적·상업적으로 실현 가능하게 만드는 타협 불가능한 전제 조건입니다. 뉴욕타임스 대 OpenAI 판결 선례는 ZDR이 보장되지 않는 한, 귀사의 데이터가 전적으로 통제 불가능한 외부 압력에 노출될 수밖에 없음을 여실히 보여주었습니다.

모델이 유용한 가치를 창출하기 위해 귀사의 데이터로부터 매번 “학습”해야 할 필요는 없습니다. 추론 시점의 컨텍스트 윈도우(context window) 내에서 귀사의 데이터를 바탕으로 논리적으로 사고하고 추론하기만 하면 됩니다. 그리고 ZDR은 그 추론이 끝나는 즉시 해당 데이터가 오직 귀사만의 자산으로 남을 수 있도록 보장합니다.


참고 자료 (Sources)

연구 노트: [[Zero-Data-Retention-ZDR-Frontier-LLM-Providers-Deep-Analysis]]

관련 기사