首页 > 文章 > 经济 > 产业研究

你发给AI的创意与隐私会被泄露吗?

环球科学 · 2026-09-23 · 来源:美国史教学与研究 | 微信公众号
字体: / /

图片

图片来源:unsplash

编译 | 不周

9月8日,OpenAI宣布,其尚未对公众开放的人工智能(AI)系统攻克了一道悬赏百万美元的数学难题——纳维-斯托克斯问题。这条消息震动了AI和数学界,也显示出AI在应对前沿数学难题时的潜力。

然而,在一片喧嚣中,美国纽约大学教授特里斯坦·巴克马斯特(Tristan Buckmaster)却在思考:OpenAI解决这道难题,是否借鉴了他的研究?此前他与合作者列文·阿尔珀格(Levent Alpöge)一直在利用AI探索相近的解题思路,而他们使用的模型之一恰好来自OpenAI。

图片

图片来源:Tristan Buckmaster

OpenAI起初表示,虽然可能性很小,但不能排除巴克马斯特等人使用其产品时产生的去标识化数据曾帮助改进模型。但随后,OpenAI又在发给《时代周刊》(The Times)的邮件中明确声明:巴克马斯特在此前两个月输入Codex的提示,不可能以任何方式影响这一系统。

巴克马斯特的研究是否影响了这套系统,我们暂不知晓,但他的疑虑并不只属于数学家。如今日常频繁使用大语言模型的我们,或多或少都有过相似的戒备:当我们将尚未公开的计划、工作资料、健康问题乃至私人隐私输入聊天机器人时,这些内容会不会被悄悄拿去训练下一代模型?如果确实用了,模型中又会留下什么痕迹?

对话记录会泄露吗?

要搞清对话记录是否会被拿去训练,最直接的线索是产品服务协议。2025年,一项发表于《AAAI/ACM人工智能、伦理与社会会议论文集》(Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society)的研究,系统梳理了这一问题。

研究人员横向对比了美国六家主流大模型厂商的28份隐私政策、附属说明及聊天界面提示,逐一排查用户输入、模型回复与上传文件的最终去向。分析表明,这六家厂商的条款中普遍保留了将用户交互用于训练或改进系统的权利,且通常对个人消费者与企业客户施行两套不同的规则。

图片

图片来源:OpenAI

不过各家政策变动频繁,这项研究捕捉的只是2025年发布的政策。以ChatGPT为例,OpenAI现行规则明确指出,个人版内容默认可能用于模型训练,但用户有权主动退出,而企业与API产品的数据则默认不被抓取。大家在设置界面常见的“为所有人改进模型”开关,正是行使这项选择权的通道。

美国斯坦福大学的AI研究员阿尼什·穆皮迪(Aneesh Muppidi)在接受《纽约时报》(New York Times)采访时解释道:“你可以假设,你在个人账户上分享的任何数据都可能被用来训练新系统。但并非所有数据都会被投入到新技术中。”

模型会记住什么?

而即便某段对话真的被用于训练,也不意味着模型内部藏着随时能被调取的聊天数据库。训练给模型带来的影响主要分为两类:一是可能改变模型回答某类问题的方式,二是它在某些条件下复现了输入中的具体文字或私人信息。两者虽都算“留下了痕迹”,但对用户隐私造成的风险并不相同。

2026年发表于《自然·通讯》(Nature Communications)的一项研究,直观展示了第二种影响的发生机制。研究人员针对经过持续预训练或微调的医学模型,测试其会记住多少训练材料。测试素材涵盖了公开医学文献、考试题库以及一家医院超过1.3万份真实的住院病历。

实验发现,当给定特定开头的提示词时,模型在某些设置下输出与训练材料连续相同的片段,甚至还原出了受保护的临床敏感数据。这项研究表明,模型有时保留下来的不仅是概括性的知识,也可能是具体内容。

图片

图片来源:Unsplash

但“记住”的定义十分复杂。模型记住诊疗指南可能帮助医学模型回答问题,反复输出病历模板可以算作统计冗余,可以一旦输出能够识别患者的身份信息,这种“记住”就变成了隐私泄露。这项研究在医学模型上量化了“记住”出现的概率,同时也尝试区分不同记忆类型的风险阈值。

这项研究的结论不能直接理解为“普通用户的聊天有多大概率被别人问出来”。因为医学模型的测试建立在严格的数据配比和训练手段之上,且研究者必须给出精确的前缀作为提示,才可能诱导模型补全剩余文字。现实中毫无线索的陌生人,很难盲测出这种结果。而这项研究的真正警示在于,如果敏感内容进入训练,仅凭“模型学习的是模式”,还不足以断定原有信息绝不会再现。

那些相似的回答

反过来,模型说出一个正确的邮箱或电话号码,也未必说明它记住了某人的训练数据。2026年计算语言学协会年会(ACL)收录的一篇论文,恰好重新审视了学术界测量大模型隐私泄露的评估方法。

研究人员发现,过往很多隐私泄露测试在设计上存在明显漏洞,其提示词本身已经给出过量的信息提示。比如,给模型一个姓名让它输出邮箱地址,或者补全电话号码的最后两位。模型有时确实能输出正确答案,但往往只是利用通用常识进行的推理补全。

为排除这种影响,研究人员在32种语言的测试中控制了提问与目标信息的重合程度。线索减少后,准确提取个人信息的情况明显变少。这是这篇论文带来的重要修正:看到模型输出了某项信息,需要先判断它是在复现训练材料,还是根据提示自发推断出来的。不过这项研究主要评估的是通用预训练阶段的表现,并没有测试新增聊天记录在微调阶段是否会出现泄露隐私的风险。

图片

图片来源:Unsplah

而对于巴克马斯特而言,他担心的并不是原话被直接复述,而是自己的学术直觉是否曾帮模型找到探索的方向。美国华盛顿大学教授、艾伦人工智能研究所创始CEO奥伦·埃齐奥尼(Oren Etzioni)在接受《纽约时报》采访时表示,模型或许读过大量关于泰勒·斯威夫特(Taylor Swift)或炸薯条的文字,却很少能见到解决纳维-斯托克斯问题的新想法。

“当你身处一个非常独特的领域时,一个罕见的想法就像是空房间里唯一的独白,”埃齐奥尼的比喻准确解释了研究人员的担忧,但无法证明OpenAI听到了巴克马斯特的那一个声音。在AI时代,这种可能性正在让许多科学家感到焦虑。

“这个问题并没有简单的答案,”美国普林斯顿大学计算机科学教授桑吉夫·阿罗拉(Sanjeev Arora)表示,“我们不知道这些模型内部究竟发生了什么。”但他认为,随着AI模型技能远超人类能力范围,这个问题可能很快就会变得没有意义。

参考链接:

https://www.nytimes.com/2026/09/10/science/chatbot-stealing-ideas.html

https://ojs.aaai.org/index.php/AIES/article/view/36646

https://www.nature.com/articles/s41467-026-73779-6

https://aclanthology.org/2026.acl-long.1560/

https://en.wikipedia.org/wiki/Navier%E2%80%93Stokes_priority_controversy

「 支持乌有之乡!」

乌有之乡 WYZXWK.COM

您的打赏将用于网站日常运行与维护。
帮助我们办好网站,宣传红色文化!

注:配图来自网络无版权标志图像,侵删!
声明:文章仅代表作者个人观点,不代表本站观点——乌有之乡 责任编辑:王卧龙

欢迎扫描下方二维码,订阅乌有之乡网刊微信公众号

收藏

心情表态

今日头条

点击排行

  • 两日热点
  • 一周热点
  • 一月热点
  • 心情
  1. 一个劣迹斑斑的文化败类,为何会被某些人追捧?
  2. 毛主席不肯坐的轿子,今天抬了两条狗上泰山!
  3. 潘斌:一个网站关了,一个问题没关——人境网关停之后,换一副眼镜看舆论
  4. 实话实说小岗村事件
  5. 有关伟人的4010件原始档案,正在击碎历史谣言
  6. 当9月9日遇上9月10日,我们为什么不能问一句“为什么”?
  7. 当资本把一切都标上价格,连14岁的女孩也不例外
  8. 关于培养接班人问题的讲话
  9. 隐秘的掠夺:当"政策内鬼"披着合法外衣收割民生
  10. 1990 年代下岗:数千万人的"铁饭碗"怎么一夜碎了?
  1. 为什么林*要发动政变?
  2. 退休副省长家里被盗,说还是不说
  3. 《毛泽东选集》第五卷为何成了禁书?
  4. 奚仁德:叫一人错误,让全党光荣
  5. 郝贵生:“小康社会”思想的实质是“天下为私”
  6. 81岁判三年,38岁判十年,哈哈哈
  7. 吴铭:我们究竟为什么要这么干
  8. 一个劣迹斑斑的文化败类,为何会被某些人追捧?
  9. 陈俊杰:高晓松还乡团试水秦皇岛海浪电影周之辨
  10. 毛远新 | 关于1973年基辛格访华
  1. 天眸:许家印案是一个时代的病理切片
  2. 同样都是诞辰纪念大会,为何如此搞双标?
  3. 陈俊杰:耿洪伟打假刘光慧、曲静与《Nature》举步维艰的背后:学术殖民的草蛇灰线
  4. 为何将9月10日设为教师节?——写在9月9日伟大导师的忌日
  5. 前事岂能忘!“粉碎”为哪桩?——沉痛悼念毛主席逝世五十周年
  6. 为什么林*要发动政变?
  7. 人境网突遭关闭!
  8. 我们是否还能重建社会主义?
  9. 飞舟:戳穿王彬彬对“文革”的恶意泼污
  10. 这盛世,真的“如您所愿”吗?
  1. 刚刚传回!毛东东随团赴朝,正式祭拜毛岸英!讲话催泪…
  2. 音乐舞蹈史诗《东方红》诞生的台前幕后
  3. 《毛泽东选集》第五卷为何成了禁书?
  4. 为什么林*要发动政变?
  5. 沉痛讣告:江山同志在京逝世,享年81岁
  6. 81岁判三年,38岁判十年,哈哈哈