写在前面2026年2月12日,一个普通的周三,OpenAI向美国众议院中国问题特别委员会递交了一份措辞严厉的备忘录。这份文件没有谈论GPT-5的发布时间,也没有抱怨算力短缺,而是指控一家中国公司——DeepSeek——使用了一种名为”蒸馏”的技术,“系统性、持续性地无偿利用美国顶尖AI实验室开发的能力”。
OpenAI在备忘录中写道:DeepSeek员工开发了专属代码,能以程序化方式大量获取美国AI模型的输出数据,用于蒸馏训练。他们使用混淆的第三方路由器和隐藏来源,规避访问限制。OpenAI称之为”搭便车”行为,警告这”冲击美企商业利益与国家安全”。
这份备忘录像一颗深水炸弹,在硅谷、华尔街和华盛顿同时引爆。但问题是:蒸馏到底是什么?它真的等于偷窃吗?如果OpenAI自己都广泛使用这项技术,为什么还要指控别人?更重要的是——这跟我有什么关系?
读完这篇文章,你将明白该如何站队。
让我们从头说起。
第一章 老师教学生,算不算抄袭?2014年的秋天,多伦多大学的Geoffrey Hinton——后来被称为”深度学习教父”的男人——向顶级学术会议NeurIPS提交了一篇论文。这篇论文提出了一个看似简单的想法:让一个小型神经网络模仿大型神经网络的输出,从而学会大型网络的能力。
审稿人的反馈是:“这个想法不太可能有影响力。”
这篇被拒稿的论文最终在次年发表,标题叫《Distilling the Knowledge in a Neural Network》。今天,它已被引用超过两万次。Hinton后来开玩笑说,那篇论文被拒稿,可能是因为审稿人”不太懂深度学习”。
但Hinton真正厉害的地方,在于他创造了一个绝妙的比喻。他说,想象一个经验丰富的老教授(教师模型)和一个年轻的学生(学生模型)。老教授不仅知道正确答案,还理解为什么其他答案是错的,以及不同答案之间的细微差别。年轻学生通过模仿老教授的思维方式,不仅学习到了知识,还学习到了思考的方法。
这就是”蒸馏”的本质——不是复制答案,而是学习思考的方式。
具体来说,当一个大型AI模型(比如GPT-4)回答问题时,它输出的不仅仅是一个答案,而是一个概率分布——比如”这个问题80%是A,15%是B,5%是C”。这个概率分布包含了丰富的信息:它不仅告诉我们正确答案是什么,还告诉我们其他答案的可能性,以及不同答案之间的关系。
Hinton把这种隐藏在其他答案中的信息称为”暗知识”(Dark Knowledge)。就像一位经验丰富的医生,看到病人的症状后,不仅知道最可能的诊断,还能说出其他可能的疾病及其概率。这种”暗知识”是硬邦邦的教科书上学不到的,它来自于大量的实践和经验积累。
蒸馏技术的核心,就是让小型模型学习这些”暗知识”。通过模仿大型模型的概率分布,小型模型可以在保持较小体积的同时,获得接近大型模型的能力。这就像一位年轻医生通过跟随资深专家学习,快速积累临床经验,而不需要亲自看几十年的病人。
这项技术听起来很美好,对吧?它让AI模型变得更小、更快、更便宜,让更多人能够使用先进的AI能力。但问题是:如果这位”老师”不愿意教呢?
第二章 500亿美元的”搭便车”指控2025年1月20日,杭州的一家名为DeepSeek的AI公司发布了一款名为R1的推理模型。这家公司名不见经传,母公司是一家量化对冲基金。但R1的表现震惊了全球AI界:它在数学、代码和推理任务上达到了与OpenAI o1相当的水平,而训练成本 reportedly 只有560万美元。
560万美元是什么概念?OpenAI训练GPT-4的成本估计超过1亿美元。DeepSeek使用的还是降级版的NVIDIA H800 GPU——因为美国出口管制,中国公司买不到顶级芯片。
更令硅谷震惊的是,DeepSeek采用了MIT开源许可证,将模型权重完全公开。这意味着任何人都可以免费下载、使用、修改这个模型。每百万token的输出成本仅2.19美元,而OpenAI o1的定价是60美元——相差近30倍。
DeepSeek应用迅速登顶美国App Store免费榜。1月27日,华尔街开盘,英伟达股价暴跌17%,市值蒸发约6000亿美元——这是美国上市公司历史上最大的单日跌幅。投资者突然意识到:如果AI模型可以如此廉价地训练,那么卖芯片的英伟达还能维持高估值吗?
OpenAI的回应来得很快。1月29日,OpenAI向《金融时报》确认,他们发现DeepSeek使用了”蒸馏技术”来提取OpenAI模型的知识。微软的安全研究人员检测到与DeepSeek关联的账户在2024年秋季通过API大规模提取数据。
白宫AI与加密货币事务负责人David Sacks公开表示,有”实质性证据”表明DeepSeek蒸馏了OpenAI的模型。他解释说:“学生模型向父模型提出大量问题……基本上可以模仿从父模型学到的推理过程……本质上是从父模型中吸取知识。”
但DeepSeek否认了这些指控。2025年9月,DeepSeek R1论文通过Nature同行评审,成为首个在顶级学术期刊发表的主流大模型。八位专家审查后,DeepSeek明确否认使用OpenAI模型输出进行训练,并首次披露从V3-Base到R1的训练成本仅29.4万美元。
这场争议的核心问题是:蒸馏到底算不算抄袭?
从技术上讲,蒸馏和抄袭有本质区别。抄袭是复制内容,而蒸馏是学习模式。就像学生通过做老师出的练习题来学习,最终参加同样的考试——如果学生考得更好,我们能说这是抄袭吗?
但从商业角度看,OpenAI的愤怒可以理解。他们投入了数十亿美元、数万块顶级GPU和顶尖人才,才训练出GPT-4。如果竞争对手可以通过API查询(每次查询成本仅几美分)来复制这种能力,那么OpenAI的商业模式就会崩溃。
这就像一个厨师花了十年时间研发一道招牌菜,然后有人每天来餐厅点这道菜,品尝后回家自己摸索做法,最后以更低的价格出售类似的菜品。技术上没有偷窃配方,但商业上确实”搭了便车”。
第三章 OpenAI的”双重标准”困境这里有一个讽刺的事实:OpenAI自己也是蒸馏技术的大量使用者。
OpenAI的GPT-4o Mini、微软的Phi-3、Google的Gemini Nano——这些小型模型都是通过蒸馏大型模型训练出来的。OpenAI甚至在2024年11月的开发者大会上正式推出了”蒸馏功能”,帮助开发者将GPT-4的能力转移到更小的定制模型上。
那么,为什么OpenAI可以使用蒸馏,DeepSeek就不行?
答案藏在OpenAI的服务条款里。条款明确禁止”使用输出来开发与OpenAI竞争的模型”。换句话说,你可以用GPT-4的输出训练模型,但不能用来训练与GPT-4竞争的模型。
但这里有几个问题:
第一,什么是”竞争”? 如果我用GPT-4的输出训练一个专门用于医疗诊断的小模型,这算不算竞争?如果我训练一个专门用于中文诗歌创作的小模型呢?界限非常模糊。
第二,举证困难。 OpenAI声称DeepSeek使用了蒸馏,但DeepSeek否认。由于只有最终模型是公开的,训练数据不公开,OpenAI很难提供确凿证据。就像指控某人偷学了你的武功,但他已经练成了,你怎么证明他的内功心法是跟你学的?
第三,OpenAI自己的”原罪”。 OpenAI训练GPT-4时,使用了互联网上大量未经授权的文本数据——包括新闻文章、书籍、学术论文。《纽约时报》正在起诉OpenAI侵犯版权。如果OpenAI可以未经许可使用他人的内容训练模型,为什么DeepSeek不能未经许可使用OpenAI的输出来训练模型?
这就像一个人从图书馆借了很多书,抄写后出版了自己的作品,然后指责另一个人抄写了他的作品。逻辑上很难自洽。
更深层的问题是:AI模型的输出,到底受不受版权保护?
美国版权局的立场是:缺乏足够人类智力投入的AI生成内容,不太可能获得版权保护。也就是说,GPT-4生成的文本,可能不受版权法保护。如果是这样,使用这些文本来训练新模型,就不构成版权侵权。
但OpenAI的商业模式建立在这样一个假设上:他们的模型输出是有价值的,人们应该为此付费。如果这种价值可以被免费复制,那么OpenAI的商业模式就会受到威胁。
所以,OpenAI对DeepSeek的指控,不仅仅是关于”抄袭”或”蒸馏”的技术问题,更是关于商业模式的保卫战。
第四章 蒸馏是好是坏?一个复杂的道德光谱现在我们来回答核心问题:蒸馏技术本身,到底是好是坏?
答案是:它既不是绝对的好,也不是绝对的坏,而是一个具有双重效应的工具。就像火可以取暖也可以纵火,刀可以切菜也可以伤人,蒸馏技术的效果取决于使用的方式和目的。
让我们从三个维度来分析:
维度一:技术创新 vs 知识产权从技术创新角度看,蒸馏是一项重大突破。它让AI模型变得更小、更快、更便宜,让更多人能够使用先进的AI能力。没有蒸馏,我们可能永远无法在手机上运行大型语言模型,也无法在偏远地区部署AI医疗诊断系统。
DistilBERT、TinyBERT、MobileBERT——这些通过蒸馏产生的模型,让BERT的能力可以在移动设备上运行。DeepSeek的蒸馏模型让中小企业能够以极低成本使用接近GPT-4的能力。这些都是技术民主化的进步。
但从知识产权角度看,蒸馏确实存在”搭便车”的问题。如果一家公司投入了数十亿美元研发AI模型,另一家公司却可以通过API查询以极低成本复制这种能力,那么创新的激励机制就会被破坏。长期来看,这可能导致没有人愿意投入巨资研发前沿模型。
维度二:开源精神 vs 商业利益开源社区普遍认为,蒸馏是促进技术进步的合法手段。Meta的Llama系列模型明确允许蒸馏等二次开发,其开放模型下载量已超过4亿次。开源的支持者认为,知识应该自由流动,蒸馏让AI技术更加普惠。
但商业公司认为,蒸馏威胁了他们的投资回报。如果竞争对手可以通过蒸馏快速追赶,那么投入巨资研发前沿模型的公司就会处于不利地位。这可能导致AI产业走向”秘密主义”,各家公司都把自己的技术封闭起来,不再分享研究成果。
维度三:国际竞争 vs 技术合作在中美AI竞争的背景下,蒸馏争议被赋予了地缘政治意义。美国政府担心,中国公司通过蒸馏技术快速追赶美国的前沿AI能力,威胁美国的科技领先地位。出口管制、技术封锁——这些措施都是为了延缓中国的AI发展。
但技术专家指出,蒸馏技术本身无法被封锁。它是一种算法思想,不是硬件设备。即使限制GPU出口,即使封锁API访问,蒸馏的思想仍然可以被使用。而且,美国公司也在广泛使用蒸馏技术——这不是一个”中国 vs 美国”的问题,而是一个”开源 vs 闭源”、“创新 vs 保护”的全球性问题。
第五章 OpenAI到底在怕什么?很多人以为,OpenAI指控DeepSeek,只是因为DeepSeek抢占了市场份额。但这只是表面现象。更深层的恐惧是:蒸馏技术可能颠覆整个AI产业的商业模式。
当前的AI产业建立在这样一个假设上:bigger is better(越大越好)。要训练最好的模型,需要最多的算力、最多的数据、最多的参数。这形成了一个”护城河”:只有拥有巨额资金的公司才能训练顶级模型,小公司只能使用API或开源模型。
但蒸馏技术挑战了这个假设。它表明,小模型可以通过学习大模型的”暗知识”,达到接近大模型的能力。这意味着,“护城河”可能没有那么深。一家小公司,只要有足够好的蒸馏技术,就可以用极低成本复制大公司的能力。
这对OpenAI的商业模式是致命威胁。OpenAI的估值建立在”GPT-4是不可复制的领先技术”这一假设上。如果这种技术可以被廉价复制,那么OpenAI的竞争优势就会消失,其高估值也就无法维持。
更可怕的是,蒸馏可能导致”模型同质化”。如果所有公司都通过蒸馏GPT-4来训练自己的模型,那么这些模型都会变得像GPT-4,失去多样性。长期来看,这可能抑制创新,因为没有人愿意从头研发新的模型架构,而是都选择蒸馏现有的最佳模型。
所以,OpenAI对DeepSeek的指控,不仅仅是关于”抄袭”的道德愤怒,更是关于生存恐惧的商业反应。他们害怕的不仅是丢失市场份额,而是整个商业模式的崩溃。
第六章 普通人应该关注蒸馏吗?你可能会问:这跟我有什么关系?我又不是AI研究员,也不是硅谷投资人。
但事实上,蒸馏技术与你息息相关,因为它正在改变AI的成本结构和可及性。
1. AI将变得更便宜蒸馏技术让小型模型能够以极低成本获得接近大型模型的能力。DeepSeek的每百万token输出成本仅2.19美元,而OpenAI o1是60美元。这意味着,未来你使用的AI服务可能会大幅降价。
对于企业来说,这意味着AI应用的门槛大幅降低。以前只有大公司才能负担得起AI,现在中小企业甚至个人开发者都能使用先进的AI能力。
2. AI将无处不在蒸馏让AI模型可以在手机、智能家居、汽车等设备上本地运行,而不需要联网。这意味着你的数据不需要上传到云端,隐私得到更好的保护。同时,响应速度更快,不需要等待网络传输。
想象一下,你的手机可以运行一个接近GPT-4水平的AI助手,完全离线,不收集你的数据,响应速度极快——这就是蒸馏技术带来的未来。
3. AI能力将快速普及蒸馏技术让知识传递变得高效。一个新模型可以通过蒸馏快速学习现有最佳模型的能力,而不需要从头训练。这意味着AI技术的进步速度会加快,新能力会更快普及。
对于普通人来说,这意味着你可以更快地享受到AI技术的最新成果。不需要等待大公司发布新产品,开源社区可能会快速跟进。
4. 但也可能带来风险蒸馏技术也可能带来风险。如果所有模型都通过蒸馏GPT-4来训练,那么GPT-4的偏见和错误也会被传递下去。而且,如果模型变得同质化,我们可能会失去多样性,所有AI都变得”千篇一律”。
此外,蒸馏技术可能被滥用。恶意行为者可以通过蒸馏,快速复制一个有害模型(比如生成虚假信息或深度伪造的模型)。
第七章 如何理性看待蒸馏争议?一个分析框架面对蒸馏争议,普通人很容易被情绪左右——要么支持OpenAI,认为DeepSeek是”小偷”;要么支持DeepSeek,认为OpenAI是”垄断者”。但真相往往比这复杂得多。
这里提供一个分析框架,帮助你理性看待这个问题:
框架一:区分技术、法律和道德三个层面技术层面:蒸馏是一项中性的技术创新,本身没有好坏之分。它既可以让AI更普惠,也可以被用来”搭便车”。
法律层面:目前法律对蒸馏的界定非常模糊。OpenAI的服务条款禁止竞争性蒸馏,但这种条款的合法性存在争议。AI生成的输出是否受版权保护,各国法律也没有统一标准。
道德层面:这是一个灰色地带。如果DeepSeek确实大规模提取OpenAI的输出来训练竞争模型,这在道德上确实存在问题——即使技术上合法。但如果DeepSeek只是使用了少量示例作为参考,主要依赖自己的创新,那就另当别论。
框架二:区分”学习”和”复制”蒸馏的本质是学习,而不是复制。就像学生通过学习老师的解题方法来提高自己的能力,最终可能超越老师。我们不能因为学生学习了老师的方法,就指责学生抄袭。
但问题在于,AI领域的”学习”和”复制”界限模糊。如果DeepSeek的模型在回答某些问题时,与GPT-4的输出几乎一模一样,那可能确实存在问题。但如果DeepSeek只是学习了GPT-4的推理模式,然后发展出自己的风格,那就是合法的学习。
框架三:考虑产业生态的长期健康我们需要考虑的不仅是”谁对谁错”,更是”什么样的规则有利于AI产业的长期发展”。
如果完全禁止蒸馏,可能会阻碍技术创新,让AI能力集中在少数大公司手中。但如果放任蒸馏,可能会破坏创新的激励机制,没有人愿意投入巨资研发前沿模型。
理想的规则可能是:允许蒸馏用于研究和非商业用途,但对商业竞争设置一定的限制。或者,建立一个”蒸馏许可”机制,让模型开发者可以选择是否允许他人蒸馏自己的模型,以及收取一定的费用。
框架四:关注地缘政治因素蒸馏争议不仅仅是技术和商业问题,还涉及中美技术竞争。美国政府担心中国通过蒸馏技术快速追赶美国的AI能力,因此采取了出口管制、技术封锁等措施。
但技术专家指出,蒸馏思想无法被封锁。它是一种算法,不是硬件。而且,美国公司也在广泛使用蒸馏技术。将蒸馏问题”政治化”,可能无助于解决问题,反而会加剧技术分裂。
第八章 蒸馏等于抄袭吗?最终答案现在我们可以回答文章开头提出的问题了:
蒸馏等于抄袭吗?
答案是否定的。 蒸馏和抄袭有本质区别。抄袭是复制内容,而蒸馏是学习模式。就像学生通过学习老师的解题方法来提高自己的能力,蒸馏是让小型AI模型学习大型模型的”思考方式”,而不是复制其具体答案。
那么,DeepSeek应该被谴责吗?
这取决于具体事实。如果DeepSeek确实大规模、系统化地提取OpenAI的输出来训练竞争模型,违反了OpenAI的服务条款,那么在道德上确实存在问题。但如果DeepSeek主要是依靠自己的技术创新(如强化学习算法),只是少量参考了OpenAI的输出,那就不应该被谴责。
目前的证据并不充分。OpenAI声称有”实质性证据”,但并未公开。DeepSeek否认指控,且其论文通过了Nature的同行评审。在缺乏确凿证据的情况下,我们不应该急于下结论。
OpenAI只是在乎丢失的市场吗?
不只是。OpenAI确实担心市场份额,但更深层的是对商业模式崩溃的恐惧。如果蒸馏技术让竞争对手可以廉价复制GPT-4的能力,那么OpenAI投入的数十亿美元研发成本就无法收回,其高估值也无法维持。
这是一种合理的商业担忧,但OpenAI的应对方式(向国会告状、政治化问题)可能不是最佳选择。更好的方式可能是:通过技术创新保持领先,或者开发反蒸馏技术来保护自己的模型。
普通人应该关注蒸馏吗?
应该。蒸馏技术正在改变AI的成本结构和可及性,让AI变得更便宜、更普及。未来,你可能每天都在使用经过蒸馏的AI模型,而不自知。了解这项技术,有助于你更好地理解AI产业的发展趋势,做出更明智的决策。
结语:在知识的边界上蒸馏争议揭示了一个深刻的矛盾:在AI时代,知识变得越来越容易转移,但我们的法律、道德和商业规则还没有准备好应对这种变化。
我们习惯于将知识视为可以拥有的财产——这是我的专利,那是你的版权。但AI模型学到的”暗知识”,是一种抽象的、难以界定的存在。它既不是具体的文本,也不是可执行的代码,而是一种”从输入到输出的映射”。
当这种映射可以被廉价复制时,我们该如何界定所有权?我们该如何平衡创新激励和知识共享?我们该如何防止”搭便车”,同时又不阻碍技术进步?
这些问题没有简单的答案。它们需要技术专家、法律学者、政策制定者和整个社会共同探讨。
但有一点是明确的:蒸馏技术本身是中性的,它的价值取决于我们如何使用它。如果我们用它来促进技术民主化,让更多人享受到AI的好处,它就是好的。如果我们用它来”搭便车”、破坏创新激励,它就是坏的。
作为普通人,我们不需要选择站队——支持OpenAI或支持DeepSeek。我们需要的是保持理性,理解这个问题的复杂性,支持建立一个既能保护创新、又能促进共享的规则体系。
因为最终,AI技术的发展不仅影响硅谷的大公司,也影响每一个普通人。我们都有权利享受AI带来的便利,也有责任确保这项技术被正确使用。
蒸馏,只是这场更大变革的开始。