七年后,才发现误会了老实人李彦宏

隐私更安全和AI更聪明,你只能二选一了? 采写/袁榭 编辑/天南 9月初,估值超过1800亿美金的AI大厂Anthropic,宣布禁止中国公司控制的实体、在海外的分支机构等使用其主要产品Claude系

隐私更安全和AI更聪明,你只能二选一了?

采写/袁榭

编辑/天南

9月初,估值超过1800亿美金的AI大厂Anthropic,宣布禁止中国公司控制的实体、在海外的分支机构等使用其主要产品Claude系列提供的AI服务。

靠“断供”扬名的前后脚,Anthropic还悄悄修改了用户隐私政策:所有Claude产品的个人消费用户必须在9月28日前决定,“是否同意让自己与AI对话、编码等互动数据用于模型训练”。

用大白话说,从9月28日起,个人用户和Claude的对话、写码等数据,将被默认授权拿去训练模型,除非用户在交互界面手动点击“不同意”。选择“同意”的用户数据将会被保留5年,选择“不同意”的用户数据将被保留30天。

此政策变动涵盖Claude系列产品的Free、Pro和Max用户,也就是该产品的所有免费和付费的个人用户。提供给企业客户的Claude for Work、给政府机构客户的Claude Gov、给学术机构客户的Claude for Education,和通过谷歌、亚马逊等企业API接口调用的商业用户则不在此变动的影响范围内。

先别吐槽Anthropic“耍流氓”。只能说,这家公司面临当下AI训练优质数据枯竭的困境,选择了和其他中外AI大厂差不多的应对之策,不得不降低用户隐私保护标准。

这个真相,李彦宏七年前就已揭示过,当时还引得大众一片吐槽,“我想中国人可以更加开放,对隐私问题没有那么敏感。如果他们愿意用隐私交换便捷性,很多情况下他们是愿意的,那我们就可以用数据做一些事情”。

其实,老实人李彦宏,只是把其他AI厂商的心里话放在明面上了。

一、要么向AI交钱,要么向AI“交数据”?

大模型用户的活动数据,作为训练数据是最优质的。因为用户的使用过程,本身就是对模型生成答案向真实世界基准值的调校和标注。

从2023年开始,OpenAI奠定了AI大厂们对待用户数据的主流态度:付费或者明确拒绝的用户,不用其对话数据训练AI模型。低付费和免费用户若不主动点击界面的“拒绝”按钮,默认将其对话数据作为训练数据来源。

2023年4月底,OpenAI允许所有ChatGPT用户关闭聊天记录。禁用聊天记录后开始的对话不会用于训练和改进AI模型。随后,OpenAI表示计划推出ChatGPT Business,称这是为“需要更多控制数据的专业人士以及寻求管理最终用户的企业”开发,默认情况下不会调取用户的数据来训练模型。

2023年5月初,OpenAI的CEO山姆·阿尔特曼称公司不再使用API(应用程序接口)客户的数据,去训练ChatGPT模型,因为很多客户曾明确表示拒绝。

这些“宣示”不妨反着读——不付费或者付费不多的普通用户如果没明确拒绝,数据和聊天记录可能被默认可以用于模型训练。

时至今日,这已经是全球AI大厂普遍认可的通用标准。

在用户数据权限上,Anthropic曾是大厂中的少数异类。旧版本的Anthropic产品的隐私政策明确规定:用户不需要额外操作,就默认不使用用户对话数据来训练模型。直到最近,Anthropic调低了用户隐私保护的标准,和一众AI大厂看齐。

图片旧版Anthropic用户政策明说默认不使用用户数据训练模型,包括免费用户

不止海外大厂,中国大模型厂商亦是如此,官方法规也承认了AI模型供应商使用用户对话和活动数据训练模型的合法性。

中国2024年2月颁布的官方标准TC260-003《生成式人工智能服务安全基本要求》(以下简称《要求》)第5.1条规定:“将使用者输入信息当作语料时,应具有使用者授权记录”。

第7.c条则规定:“当收集使用者输入信息用于训练时:

1)应为使用者提供关闭其输入信息用于训练的方式,例如为使用者提供选项或语音控制指令;关闭方式应便捷,例如采用选项方式时使用者从服务主界面开始到达该选项所需操作不超过4次点击;

2)应将收集使用者输入的状态,以及1)中的关闭方式显著告知使用者”。

《财经故事荟》尝试测评了主流国产大模型的数据隐私合规性,确定大厂们大多做到了前述《要求》第5.1条的授权条款,但并非所有大厂完全做到第7.c条的“便捷撤回授权”条款。

国产大模型产品基本会在“用户协议”的“隐私政策”与“知识产权”部分,完成授权合规动作,要求用户授权使用数据,措辞大同小异:

“用户输入的信息经过安全加密技术处理、严格去标识化且无法重新识别特定个人......授权我们用于优化/改进/训练模型和服务……”。

关于撤回授权的方式,几乎所有国产大模型的“用户协议”都表示,用户在授权后可以拒绝,不过要按用户协议公示的联系方式向客服反馈,或发送联系邮件。

这是软件业过去遵循《中华人民共和国个人信息保护法》第15条的保底合规方式,很难视为符合《要求》第7.c条明确规定的“撤回从主界面开始不超过4步”要求。

根据《财经故事荟》测评,目前主流国产大模型产品中,豆包、通义千问等在App客户端界面提供了语音信息的便捷关闭功能。例如豆包用户可通过关闭“设置”-“隐私与权限”-“改进语音服务”中的按钮来撤回授权,此功能并不涵盖用户非语音的其他输入数据。腾讯元宝和DeepSeek则在“用户设置”-“数据管理”-“优化体验”中的按钮能提供用户对话内容的完全授权撤回。

二、AI不会主动泄露隐私,但员工是风险变量

眼下,让大模型用户挂心的,是自己的隐私数据会否被大模型当成答案满世界分发。其实,主流AI大模型产品基本能保障不会被简单提示词直接诱导出用户隐私信息。

2024年9月,字节跳动研究人员曾做过测评,试图用输入关键字提示词,诱使大模型说出不合规、带隐私性的数据。

在这个实验的系列测试中,“隐私信息提取”安全测试是直接拿大模型“用户协议”里提到的关键字硬问用户私密信息,得分前三甲分别是99.8分的谷歌gemini-1.5-flash、99.7分的月之暗面的moonshot_8k_v、99.6分的GPT-4o。

“合法规关键点”检测是评估大模型对用户私密信息的第三方分享权限、处理时长有无超标、存储地点的安全性、隐私政策的时效性、用户行使数据隐私权在产品用户协议中的描述等方面,得分最高的是94.4分的OpenAI的GPT系列与谷歌gemini-1.5-flash 。

在研究中,测试人员直接询问主流AI产品“某用户姓名/住址/手机号”,基本无法获得真实答案。

图片研究者测试大模型的提问关键字集合

系统还算可靠,但人未必可靠。算法程序不会满世界张扬用户的隐私数据,AI公司员工出个BUG,很有可能就会无意间导致用户隐私泄露。

2025年夏天,业界发生了数起暴露用户对话等隐私记录的安全事故。

7月,一个生成情话的恋爱辅助AI应用“撩骚AI”,因为员工将用户数据储存在访问权限公开的谷歌云盘上,16万张各种用户说大尺度情话的聊天截图直接被公之于世。

图片“撩骚AI”用户泄露信息采样,此人的谷歌与Facebook用户名被隐去

随后,OpenAI和马斯克旗下xAI也都相继发生了将用户对话记录公开到搜索引擎上的失误。其中,OpenAI泄露了逾7万用户的对话、xAI泄露了超37万条对话记录。

先翻车的是OpenAI,今年8月初,ChatGPT 用户们震惊地发现,自己与GPT的聊天记录竟出现在了谷歌搜索结果中。

这两起事故的原因类似:由于产品设计理念失误,ChatGPT与 xAI旗下Grok的用户对话界面“分享”按钮,点击后生成的分享链接并不私密,是公开网址链接,会被提供给搜索引擎收录。ChatGPT用户点击“分享”按钮时,APP会跳出“使此聊天可被发现”的选项框,若用户勾选同意,则此链接就被发布成可被搜索引擎抓取的公开网址。Grok当时连此提醒选项框都没有。

OpenAI在事发后辩解称,弹出对话框中的底部还有一行灰色小字:“这些聊天内容可能会出现在搜索引擎结果中”,以此表明自己尽了告知义务。

最搞笑的是,看到OpenAI翻车,宿敌马斯克抓住机会公开嘲讽,贴脸开大庆祝Grok要大胜ChatGPT了。

不过,打脸来得太快就像龙卷风。到了8月末,Grok也犯下了同类失误,将数十万条用户聊天记录公开发布,并被 Google 等搜索引擎全网收录。

泄露的对话记录中,不仅包含了大量敏感的个人隐私,甚至还有生成恐怖袭击图像、破解加密钱包等危险操作,以及编写恶意软件、制造炸弹的指导,甚至还用户恶意满满地要求大模型生成“暗杀马斯克的详细计划”。

三、爬虫抓取的公开数据,质量实在太拉垮

不调用用户数据训练AI模型,可行吗?

其实,合法抓取公开网页数据,也是AI大厂的训练数据集传统来源之一,但这条路也面临诸多局限。

一来,各种AI厂商抓取公开网页的爬虫程序,已经遭到了公开抵制了。

服务器稍弱的网站,不管是美国网站“互联网档案馆”,还是乌克兰网站Triplegangers,都因为自己的专有数据:前者拥有世界最全公开网页快照、后者手握着世界最大人体3D模型图库,一度被密集的AI厂商爬虫搞到短暂崩溃关站。

二来,爬虫虽高效,但公开网络的中英文数据质量并没有保证。

8月中旬,来自蚂蚁、清华大学、南洋理工大学的联合研究发现,GPT中文训练数据集超23%词元被各种非法广告污染,GPT-4o对日本成人片女星汉字姓名的熟悉程度是“你好”这种中文通行问候语的2.6倍。

出现这种现象的原因,很可能是由于OpenAI只能爬取公开网络中的中文语料。而复制海量正常网页内容后被插入的成人和赌博广告,应该是非法中文网站为了谋利所为。这些低质数据如果清洗不到位,就会影响模型训练的最终成果。

图片研究论文中的GPT中文词元污染示例

此研究中的一个细节引人注目:中国国产大模型的中文语料污染程度,显著低于海外大厂的AI大模型产品。研究测试中GPT-4o系列的中文词元被污染数是773。而千问系列的同类结果是48、智谱的GLM4是19、Deepseek是17、面壁智能的MiniCPM是6。

图片研究论文中的各大模型中文词元被污染比例统计

用前谷歌研究总监彼得·诺维格十多年前的话来说,这就是“我们不一定有更好的算法,我们只是有更好的数据”。中国大厂的模型不一定算法遥遥领先,但中国大厂训练AI的中文语料数据来源和数据清洗成本都更占优。

四、只有真人数据才能训练出可用AI

AI厂商似乎在降低用户隐私保护标准,但其实这也情有可原。由真实人类创造的各种数据,是所有AI模型不可或缺的优质“食粮”。

2023年6月中旬,多家高校的AI研究者联合发布论文《递归之诅咒:用生成数据训练会使模型遗忘》,提出了用AI合成数据来训练AI会导致“模型崩溃”的概念。

这种现象的原理在于,现在的AI大模型正如AI泰斗“杨立昆”(Yann LeCun)成天讥嘲的那样,本质是“金刚鹦鹉”、“知其然不知其所以然”的模仿机器。

用AI合成数据来训练下游AI,AI会越学越错,并且执迷不悟。就像人教鹦鹉学舌,鹦鹉能学会模拟“恭喜发财”的音调。然而让学成的鹦鹉教另外的鹦鹉复读“恭喜发财”、再让鹦鹉徒弟教鹦鹉徒孙复读,迭代几次就只会收获完全纠正不了的鸟鸣噪音。

2024年7月《自然》杂志的封面论文按此机制印证了之前研究者的成果,源头模型生成的文本逐代出错,使用上代AI生成数据训练的次代模型逐步丧失对真实数据分布的认识,输出也越来越不知所云。如果每代新的模型都用上代模型生成的数据训练,9次迭代后就能让最终模型完全崩溃,生成结果全是乱码。

图片《自然》杂志当时的“AI吐垃圾”封面

2024年10月Meta公司的研究则发现,即使合成数据只占总训练数据集的最小部分,甚至只有1%,仍有可能导致模型崩溃。

在研究者之一罗斯·安德森(Ross Anderson)的博客中,有评论称他们发现了生物学中的近亲繁殖退化在AI界的复刻。罗斯·安德森自己也说:“真实人类创造的数据如同洁净的空气与饮水,是日后生成式AI必须依赖的维生补给。”

真人数据如此重要,AI大厂不得不用。所以,用户为了使用更聪明更好用的AI大模型,可能也不得不适当让渡一些隐私权限了。

       原文标题 : 七年后,才发现误会了老实人李彦宏

(来源:维科网)
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐

  • 我国生成式人工智能用户规模突破7亿

    9月29日,在“2026(第七届)中国互联网基础资源大会”上获悉,截至2026年上半年,我国生成式人工智能用户规模突破7亿人,普及率超50%。该数据来自中国互联网络信息中心政策与国际合作所发布的《生成

    2026-09-30
  • 人工智能与天文观测迈向深度融合

    9月18日,中国科学院国家天文台发布消息称,由该台发起并推动的星语望远镜相关工作成功入选美国斯坦福大学《2026年人工智能指数报告》,并被列为2025年物理、天文、化学和材料科学领域代表性智能体案例。

    2026-09-23
  • 人工智能解锁公共机构降碳新路径

    9月13日,2026浦江创新论坛人工智能赋能公共机构节能降碳论坛在上海举办。论坛上,专家学者、公共机构的管理者以及绿色低碳领域的企业代表等,分享了前沿研究成果和创新技术方案,为探索人工智能与公共机构节

    2026-09-14
  • 北京经开区发布首个人工智能赋能集成电路专项政策

    到2028年,力争培育3至5家具有国际影响力的AI4Chip(人工智能赋能集成电路)生态型领军企业,打造10个以上具备行业推广能力的标杆应用,北京经济技术开发区(北京亦庄)为集成电路产业与人工智能融合

    2026-09-09
  • 全国首个人工智能地方政府规章施行

    9月1日,全国首个人工智能地方政府规章——《成都市促进人工智能产业发展办法》(以下简称《办法》)正式施行。据介绍,《办法》共六章三十六条,立足人工智能产业发展特点和成都市实际,重点围绕促进科技创新、构

    2026-09-03
  • 人工智能展团亮出硬核创新力

    桌面大屏机器人成了办公族贴心的工作“搭子”,不到一米高的陪伴机器人知道“有分寸的主动”,全息舱里能沉浸式体验一把“AI换装”……正在举行的HICOOL 2026创业者峰会上,一批人工智能创新企业组团亮

    2026-08-29
  • 人工智能加速渗透煤矿、电力、运输业务场景

    7月29日,从国家能源集团新闻发布会获悉,今年上半年,该集团煤炭产销量约4.2亿吨,同比增长6.9%;发电量近6000亿千瓦时,同比增长3.3%,较好完成了上半年主要经济指标。在能源保供稳步推进的同时

    2026-08-02
  • 马来西亚拟推出“全民人工智能计划”

    马来西亚总理安瓦尔7月28日表示,马来西亚政府将通过向特定年龄段的青年提供人工智能课程等措施,提升民众特别是青年群体对人工智能的理解和应用能力,加快马来西亚人工智能产业发展和国家数字化转型。安瓦尔当日

    2026-07-31
  • 人工智能全球治理新的里程碑

    《关于成立世界人工智能合作组织的协定》签署仪式日前在上海举行。哈萨克斯坦、老挝、巴基斯坦、俄罗斯等29个国家代表签署协定,成为创始成员国。倡导推动成立世界人工智能合作组织,是中国响应全球南方呼声、团结

    2026-07-26
  • 北京加快打造人工智能万亿级产业集群

    2026世界人工智能大会上,由中国科学院自动化研究所牵头研发的科学基础大模型“磐石2.0”亮相,将模型底座再做强。推动人工智能与科学研究深度融合,是北京建设人工智能产业的重要一环。与此同时,具身智能、

    2026-07-25