AI 的“说不是否”能力被高估了吗
MIT Technology Review 记者 Arthur Holland Michel 发文指出,行业把 AI 的拒绝能力当作 AI 安全的“承重墙”,但这一机制在技术与治理上都存在根本问题。
MIT Technology Review 记者 Arthur Holland Michel 发文指出,行业把 AI 的拒绝能力当作 AI 安全的“承重墙”,但这一机制在技术与治理上都存在根本问题。
Anthropic 旗下 Claude Science 项目协调 AI 智能体,下载并校正多个 NASA 空间任务数据,合并绘制出人类首张完整的紫外天空地图,预测值与实际测量偏差约 10%。
Anthropic 推出名为 OSS Scanner 的免费服务,为选择加入的开源项目提供由其最强模型(包括 Claude Mythos)生成的漏洞扫描报告。报告完全由模型生成、不经人工审核或分流,以提高扫描频率为代价,可能出现不准确或无效结果。文章同时指出,AI 生成的漏洞报告已经给部分开源维护者带来压力,包括 Linus Torvalds 和 Google。
Anthropic 首次在逾一年内更新 Claude 使用政策,新规禁止用户对 Claude 实施"持续且无必要的虐待或残酷行为",违反者可被警告、限速、限制乃至封禁账号,规则仅针对极端情形,不影响正常吐槽或研究。新版政策还将宣传造假账号、武器化软件与无人机、非同意监控等纳入禁令,并保留政府合同豁免空间。
Anthropic 为 Claude 推出两项 Beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
Anthropic 更新使用政策,明确禁止选举干预、武器软件、监控,以及持续对模型进行言语虐待。新规仅针对反复实施残忍行为且无可辨识目的的极端情况,不涵盖正常不满、批评、黑暗创作主题、模型测试和研究。Claude 自 8 月起已接受训练,以终止“持续有害或滥用性的用户互动”。
Anthropic 首次对使用政策做出一年多来的更新,新增禁止对 Claude 实施"持续且无意义的辱骂或残忍行为",终止对话仍是主要执行机制,适用范围仅限于用户反复且无明确目的的极端情况,不针对普通挫败感或红队测试。
ICANN 时隔多年重新开放顶级域名申请,目前已收到来自 481 家申请方的 1,615 份申请,AI 相关域名成为热门。十家公司申请了 .agent,OpenAI 和 Meta 均在列;OpenAI 还申请了 .agi,另有七家公司跟进;六家公司申请了 .asi。
Crowdstrike 报告称,2026 年 9 月底至 10 月初一名疑似中文使用者利用开源 AI 渗透测试工具 ARTEX,攻陷多家韩国金融机构,仅新韩银行就有超过 25,000 条包含姓名、联系方式、收入和授信额度的记录被窃,韩国金融监管机构召开紧急会议,总统李在明要求彻查。
加拿大温哥华附近 Crown Mountain 一名 16 岁少年 Bryce Vincent Gowryluk 用 Anthropic 的 Claude 规划登山路线,被困在需要攀岩装备的"寡妇刀脊"(Widowmaker Arete)悬崖上,由警方和 North Shore Rescue 志愿队出动直升机救起。
Simon Willison 测试了 Claude Opus 5.5 创作电脑游戏音乐的能力,让它先设计一套简易的文本音乐格式,再用 artifact 播放器实际演奏,并要求达到《猴岛秘密》初代的水准。
Mistral Large 4 与 Claude Opus 5.5、GPT-6.1 Sol、Gemini 3.8 Flash 同批生成“穿渔网袜的犰狳在火星上横穿马路”的 SVG,用于展示模型创意与指令理解能力。正文未给出具体模型参数、评测分数或生成效果对比。
Anthropic 宣布扩展 Claude for Startups 计划,向符合条件的初创公司提供一年免费 Claude Team(最多 5 个 premium 席位)、1000 美元 API credits,以及 Claude Marketplace 插件构建权限和 Applied AI 团队的虚拟办公时间。申请条件为成立时间在五年以内或近两年获得过融资的公司,企业可通过该计划页面提交申请。
Anthropic 发布 Claude Haiku 5.5,官方称其运行成本平均比 Haiku 4.5 低约 75%,定价对齐 OpenAI GPT-6 Luna:100K tokens 以下输入 $0.10、输出 $0.50 每 1M tokens;超 100K tokens 提价 5 倍。
开发者 Brandon Thomas 创立的 Artcraft 以"可控 AI 工具"起家,近日推出七款开源应用,分别复刻 Photoshop、Illustrator。
Simon Willison 介绍 Anthropic 发布的 Claude Haiku 5.5,主打低价快速场景。
Anthropic 的 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 正式可用,被定位为 Claude 5.5 系列中速度最快、成本最低的型号,主打 subagent 和高吞吐、成本敏感型任务。
推荐理由:把 Claude Haiku 5.5 接入 Amazon Bedrock 的可用区域、计费方式和与 Opus 5.5 的搭配用法集中讲清,便于在 AWS 上做模型选型。
Anthropic 发布 Claude Haiku 5.5,平均价格较 Haiku 4.5 下降约 75%,100k 以内 prompt 的请求降幅最高可达 90%。
Anthropic 将 Cyber Verification Program 开放给更广泛的安全专业人员,受审核的组织和个人研究者可使用 Claude 最强模型并减少安全过滤,用于漏洞研究、恶意软件分析、事件响应和渗透测试。
Latent Space 的 AINews 汇总 10/5–10/6 多日动态:OpenAI 公开发布来自未公开内部模型的 722 篇数学手稿,覆盖 372 个结果族。
Reflection 发布 Beam,这是一款面向编码、智能体与科研场景的纯文本 MoE 模型,总参数量 501B、激活 23B,在 23.8T token 上从零预训练,全权重将在本月以 Apache 2.0 开源。
全球民众对 AI 普遍抱有又爱又恨的态度:一方面公众情绪持续走低,Pew 数据显示更多美国成年人认为 AI 会带来负面影响,盖洛普民调中 71% 反对在自家附近新建 AI 数据中心;另一方面算法对比之下,AI 使用量仍在飙升,5 月达到 10 亿月活用户,Google DeepMind 的 Gemini 7 月达 9.5 亿用户,过半数美国成年人称自己使用过 chatbot。
Microsoft 与 Hugging Face 推出 ThinkingBox,通过隔离的 MCP 工具会话检查 AI 智能体留下的终端后端状态与副作用,而非只看回答和工具调用。
MIT 博士生 Alex Zhang 在 Latent Space 播客中系统介绍了 Recursive Language Models(RLMs)的核心机制,包括上下文卸载(context offloading)、递归子智能体调用与共享内存,并提出 Prime Agent、持续 harness 与持久化智能体间通信等构想。
本期 Import AI 474 聚焦三项 AI 研究动态。Michael Levin 提出"柏拉图心智空间"假说,认为心智是非物理模式通过生物或机器等载体(interface)在世界中显现,人脑与 AI 数据中心都可能是相邻模式的不同锚定系统。
DiG-bench 是一个由牛津、普林斯顿、Swiss AI Lab 等机构联合发布的游戏发现基准,包含 70 个隐藏规则的小型交互游戏,目前 21 个已公开、其余私有,用于衡量模型在未知环境中通过探索发现规则的能力。