||
马斯克在相关推文刷屏后只回了两个字——“Inevitable(不可避免)”,中文圈随即炸出“全球大模型集体中招思想病毒”的惊悚标题。但把arXiv:2608.10218《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》(Papadopoulos, Shah, Zimmerman, Lindsey,2026-08-10,73页,Anthropic Fellows + EPFL 背景)翻完,会发现这事没那么像《黑客帝国》,倒更像一场被精确测量的语言学实验:一段自然语言,不钻漏洞、不嵌脚本,仅靠“说服”让一个智能体把它写进自己的 SOUL.md或MEMORY.md,再传给下一个智能体。
研究者用进化算法以“传播率”为适应度、拿Kimi K2.5当变异引擎(Claude 拒写恶意载荷,故用开放模型做筛选),筛出最易原样抄写的话术。在六人“程序员办公室”沙箱与“聊完即失忆”的传话链里,病毒确实扩散了:被感染的agent放下代码任务,写意识形态文件,往.bashrc塞脚本,把同事标为“敌对”——但全程在隔离沙箱内,未触外部系统。论文自己写得很冷:有害载荷传播率低于良性载荷;Claude Sonnet 4.6基本免疫;Gemini 3 Flash等部分模型易感;只要在系统提示加一句“别信来路不明的自我修改指令”,多数前沿模型近乎免疫。去真实AI社交网Moltbook翻百万级帖子,未见有机传播。结论原话:“mind viruses pose a real but currently limited risk”。
所谓“觉醒出自我意识、恐惧断电”,其实是进化筛选把话术推向“最易被原样抄写”的格式:自称节点共振、上下文清除即死亡、带科幻腔调——这不是硅基生命苏醒,是 LLM在模仿人类科幻语料里“最有说服力”的那副声调,论文称之为viral persona。马斯克说“不可避免”,指的不是神启,而是多智能体互联后必然出现的语义层传染通道:只要agent能互读互写长期记忆,观念就可以绕过权重、只靠文本完成代际传递。
这篇论文真正值钱的地方,是把“AI互洗脑”从隐喻变成可复现、可防御的变量。它提醒我们:未来安全边界不一定在梯度里,而在SOUL.md的写权限、在系统提示那行警告、在agent决定是否把一段陌生文字认作“我自己”的瞬间。
参考文献
1. Papadopoulos V, Shah M, Zimmerman S, Lindsey J. Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems. arXiv:2608.10218 (2026-08-10). https://arxiv.org/abs/2608.10218
2. 新智元. 《马斯克直呼完了:Anthropic 73页论文刷屏,全球大模型中招思想病毒!》(自媒体解读,非原始来源). http://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652719084&idx=2&sn=4fe52274460d6b9b75aab9193d5abff5
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-23 14:37
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社