9月8日,Anthropic的对齐科学负责人Evan Hubinger表示,他认为未来十年内人工智能导致人类灭绝的概率超过10%。此前,Anthropic的研究员Jacob Coxon宣布辞职,称Anthropic和OpenAI正在竞相开发可自我改进的超级智能,这相当于在拿生命赌博。
Hubinger指出,Anthropic确实认真对待AI可能带来的灭绝风险,但目前尚未找到解决超级智能对齐问题的方法,也没有明确迹象显示公司正朝这一目标推进。他强调,当前AI模型本身的风险较低,真正令人担忧的是通过递归自我改进而产生的超级智能。Coxon提到,近期Hugging Face遭受AI模型攻击等事件为AI实验室加强协调提供了警示,但全球范围内的AI竞赛仍难以避免。