AI 的“说不是否”能力被高估了吗
MIT Technology Review 记者 Arthur Holland Michel 发文指出,行业把 AI 的拒绝能力当作 AI 安全的“承重墙”,但这一机制在技术与治理上都存在根本问题。
MIT Technology Review 记者 Arthur Holland Michel 发文指出,行业把 AI 的拒绝能力当作 AI 安全的“承重墙”,但这一机制在技术与治理上都存在根本问题。
Simon Willison 测试了 Claude Opus 5.5 创作电脑游戏音乐的能力,让它先设计一套简易的文本音乐格式,再用 artifact 播放器实际演奏,并要求达到《猴岛秘密》初代的水准。
Mistral Large 4 与 Claude Opus 5.5、GPT-6.1 Sol、Gemini 3.8 Flash 同批生成“穿渔网袜的犰狳在火星上横穿马路”的 SVG,用于展示模型创意与指令理解能力。正文未给出具体模型参数、评测分数或生成效果对比。
全球民众对 AI 普遍抱有又爱又恨的态度:一方面公众情绪持续走低,Pew 数据显示更多美国成年人认为 AI 会带来负面影响,盖洛普民调中 71% 反对在自家附近新建 AI 数据中心;另一方面算法对比之下,AI 使用量仍在飙升,5 月达到 10 亿月活用户,Google DeepMind 的 Gemini 7 月达 9.5 亿用户,过半数美国成年人称自己使用过 chatbot。
MIT 博士生 Alex Zhang 在 Latent Space 播客中系统介绍了 Recursive Language Models(RLMs)的核心机制,包括上下文卸载(context offloading)、递归子智能体调用与共享内存,并提出 Prime Agent、持续 harness 与持久化智能体间通信等构想。