已经有真实案例了。今年5月20日有国外安全厂商披露了一种"算法霸权系统"能通过GEO技术操控AI模型的输出。简单理解就是攻击者不需要入侵模型内部,直接污染它的数据来源或者训练资料,就能让AI在特定问题上生成对攻击者有利的内容。
更细思极恐的是,这种做法的成本很低、而且很难被察觉——脏数据可能来自某个被篡改的开源数据集,也可能藏在某个看似正常的信息检索源头。LLM训练需要海量数据,质量控制本身就是个系统性难题,攻击者只需混入极少量精心构造的污染样本,AI就可能"中毒",而且后续无论怎么反复清洗,某些错误信息也会被固化下来。
这意味着AI的输出不能轻易当成"事实"来对待。AI安全防御不再只是防止黑客入侵,还有数据源头被污染导致输出失真的风险。基础不牢靠,上层建筑的AI输出就会出问题。