Anthropic 发布 Claude Haiku 5.5,定价对齐 OpenAI GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,官方称其运行成本平均比 Haiku 4.5 低约 75%,定价对齐 OpenAI GPT-6 Luna:100K tokens 以下输入 $0.10、输出 $0.50 每 1M tokens;超 100K tokens 提价 5 倍。
Anthropic 发布 Claude Haiku 5.5,官方称其运行成本平均比 Haiku 4.5 低约 75%,定价对齐 OpenAI GPT-6 Luna:100K tokens 以下输入 $0.10、输出 $0.50 每 1M tokens;超 100K tokens 提价 5 倍。
Anthropic 的 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 正式可用,被定位为 Claude 5.5 系列中速度最快、成本最低的型号,主打 subagent 和高吞吐、成本敏感型任务。
推荐理由:把 Claude Haiku 5.5 接入 Amazon Bedrock 的可用区域、计费方式和与 Opus 5.5 的搭配用法集中讲清,便于在 AWS 上做模型选型。
Google 推出基于浏览器的 AI 平台 Playground,美国成年人只需输入文本即可创建游戏,无需编程技能;该平台由 Gemini、Nano Banana 和 Lyria 模型驱动,支持调整规则、物理角色和场景,生成的游戏可发布至公共画廊,部分类型支持排行榜及多人模式。同批 Google 与 Unity 发布面向专业开发者的 AI 工具 Unity Spark,闭测将于 2026 年启动。
Mistral 发布新模型 Mistral Large 4(内部代号 Le Chonk),参数规模达 1 万亿,开放权重可自由使用和定制,目前以预览版开放,月底前推出正式版。
NVIDIA 在 Hugging Face 博客公布,基于 Nemotron 3 微调的系统在 IOI 2026 与 IMO 2026 上同时达到金牌级别。
推荐理由:展示了同一基座在算法竞赛与数学奥赛两条赛道上达到金牌水平所用的微调与推理组合策略,并公开了数据集与复现入口。
Mistral 推出 Mistral Large 4(昵称 Le Chonk)公开预览 API,模型为 1 万亿参数、52 亿激活参数的原生多模态架构,训练使用 Mistral 欧洲自建数据中心中的 3800 颗 NVIDIA Grace Blackwell GPU。
推荐理由:公开预览同步给出网络与编码等多维度基准与排名,读者可横向对比当前主流闭源与开源模型的能力差距。
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,面向软件工程、法律与金融知识工作以及网络安全防御等长链路复杂流程。模型输出 token 上限从 64K 提升到 1M,定价为输入 $2 / 输出 $10 每百万 token,缓存输入享 95% 折扣。
推荐理由:官方一次性放出 1M 输出 token、$2/$10 per M tokens 定价与 Fairwind 安全分阶段策略,方便和同代前沿模型直接做能力与部署节奏比较。
GitHub Podcast 最新一期逐条回应了 AI 领域的五个热门观点:开发者仍需阅读 AI 生成代码,应根据风险灵活调整审查力度;不掌握 AI 工具不会让人失去工作。
Mistral 与一家欧洲能源运营商合作,将 4 万行 Fortran 77 油藏模拟器代码迁移到 C++,并接入 PetSc 等现代科学计算框架。项目先用 state 快照导出与 C++ 测试框架构建"数值一致性校验"基线,再通过 Vibe CLI 启动上百个智能体,配合自定义解析器生成的调用树和 Mistral OCR 整理散落文档,逐模块完成翻译与 PR 提交。
METR 研究指出,2026 年 AI 在网络安全领域带来显著加速,漏洞报告速率较 2025 年大幅上升;数学研究有少量加速但难以量化,而 AI 算法本身在七个问题领域上未出现可衡量的加速。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 交互历史压缩为自然语言 belief state,并以"belief grading"作为辅助强化学习奖励来监督摘要内容。