ttok 发布 1.0 版本,默认切换至 GPT-5/GPT-6 tokenizer
ttok 升级到 1.0 版本,将默认 tokenizer 从 GPT-4 切换为 GPT-5/GPT-6 系列。
ttok 升级到 1.0 版本,将默认 tokenizer 从 GPT-4 切换为 GPT-5/GPT-6 系列。
Simon Willison 发布 ttok 0.4,距离上次更新已过两年。ttok 是基于 OpenAI 开源 tiktoken 库的 CLI 工具,本版修复了 Click 警告、更新了 CI,并新增 --list-models 命令用于列出可用模型;通过 uvx 即可调用,典型用法为 `cat file.txt | uvx ttok`。
作者通过 Hugging Face 的 ML Intern 智能体在数天内训练并发布了 7 个模型。ML Intern 会先规划工作、申请预算,并按要求使用 Hub 硬件完成数据集构建、训练与评测。
Parseable 是一个兼容 OpenTelemetry 的新型可观测性工具,提供 AGPL 开源 Rust 版本(约 180MB 单二进制)、企业版及云托管方案。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,拥有 740M 参数,支持文本、图像、视频、音频和代码转向量。Google 称它在多模态嵌入 benchmark 上表现优于体量两倍于它的竞品,并称这是同类模型中最小的一款;在 MTEB (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
OpenAI 在 GitHub 仓库一次性发布 372 个由其内部前沿模型生成的数学结果,称每一项都试图解决一个开放问题或在关键方向上取得实质进展,其中部分工作改进了主流计算机算法并涉及黎曼猜想。
Musubi 推出开源轻量级决策模型 PolicyLM-1.7B,用于实时内容审核:可直接用自然语言编写的政策判定消息,响应时间低于 50 毫秒,成本与速度接近社交平台的传统 AI 分类器,但具备现代 LLM 的灵活性。模型输出二分类结果,政策变更时无需重新训练,便于人工迭代。该模型建立在决策模型范式上,与 TypeSafe AI 的 Jev 等同类产品思路一致,定位为可自托管的内容审核专用方案。
开发者 Brandon Thomas 创立的 Artcraft 以"可控 AI 工具"起家,近日推出七款开源应用,分别复刻 Photoshop、Illustrator。
微软研究院发布并开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与强化学习,开发者无需把 agent 重新实现到训练框架中。
推荐理由:框架以约 3,500 行代码实现与真实 agent harness 直接对接的 RL 控制平面,并用 SWE-bench Verified 上的 14.6 个百分点提升给出可复现的工程样例。
Mistral 发布新模型 Mistral Large 4(内部代号 Le Chonk),参数规模达 1 万亿,开放权重可自由使用和定制,目前以预览版开放,月底前推出正式版。
Stacklok 推出开源项目 Mecatl,自称为"云原生"的智能体 harness,由 Kubernetes 联合创始人 Craig McLuckie 和 Joe Beda 主导,6 月起在 GitHub 开源。
NVIDIA 在 Hugging Face 博客公布,基于 Nemotron 3 微调的系统在 IOI 2026 与 IMO 2026 上同时达到金牌级别。
推荐理由:展示了同一基座在算法竞赛与数学奥赛两条赛道上达到金牌水平所用的微调与推理组合策略,并公开了数据集与复现入口。
Latent Space 的 AINews 汇总 10/5–10/6 多日动态:OpenAI 公开发布来自未公开内部模型的 722 篇数学手稿,覆盖 372 个结果族。
Simon Willison 发布 llm-mistral 0.16 版本,与 llm 638 mistral 68、llm-reasoning 105 等标签相关,属于 Mistral 系列模型的 llm CLI 插件月度更新。该项目支持 $10/月订阅,作者会以摘要形式向订阅者推送当月重要的 LLM 动态。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数规模约 740M,可将文本、代码、图像、音频和视频映射到统一 embedding 空间。
OpenAI 发布内部 frontier model 在数学开放问题上的最新结果,并在 GitHub 分享 Lean 证明形式化与研究细节。材料未提供具体问题、模型名称或结果数据。
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
OpenAI 上线 GPT-6.1 Sol,定价 $2/$10 每百万输入/输出 token,比 Astra 便宜 81%,并以 39% 更低成本高出 GPT-6 Sol 1.52 分;Claude Sonnet 5.5 [Max] 进入 Agent Arena 第三名,Anthropic 包揽前三。
Ai2 旗下 Asta 团队开源 AstaBrief 8B 模型,定位为可本地运行的科学报告生成工具,基于 Qwen3-8B 经 SFT 和 DPO 后训练得到。
MIT 博士生 Alex Zhang 在 Latent Space 播客中系统介绍了 Recursive Language Models(RLMs)的核心机制,包括上下文卸载(context offloading)、递归子智能体调用与共享内存,并提出 Prime Agent、持续 harness 与持久化智能体间通信等构想。
Google DeepMind 推出 SynthID Bio,用于给 AI 设计的蛋白质序列与 AlphaFold 3 预测的三维结构嵌入可验证水印。
推荐理由:SynthID Bio 把水印从数字内容带到蛋白质序列与三维结构层面,给 AI 生成生物设计提供可验证溯源信号。
H Company 推出新一代智能体模型系列 Holo4,包含 27B dense 与 35B-A3B MoE 两款,并同步发布 Holotron4 Nano,可在 H Models API 上调用,权重已在 Hugging Face 开源(FP16/FP8/GGUF)。
GitHub Security Lab 推出基于 Taskflow Agent 的 Fuzzing Taskflow,面向 C/C++ 项目实现端到端自动化模糊测试流水线。
Microsoft Research 在《Nature》公布并开源逆合成预测模型 RetroChimera,采用 Transformer 的 R-SMILES 2 与图神经网络 NeuralLoc 集成框架,通过 learned ensembling 融合两类子模型的互补优势。
Google Research 在论文中推出开源 C++ 实例生成器 MilleMiglia,用于为"中段物流"(middle-mile)配送生成保真的合成基准数据,弥补该领域长期缺乏公开高质量数据集的空白。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款开源病理基础模型,均采用 Apache 2.0 协议。
Berkeley Sky Lab 在 K-Search 进化式核函数优化框架中加入 MLX 后端,新增一层 CUDA-to-MLX 结构化翻译,把既有 CUDA 核函数作为知识库自动改写为 Apple Silicon 可用的高质量核函数。
Berkeley AI Research 介绍 SPEX 与 ProxySPEX 两套面向 LLM 的可解释性算法,可在特征归因、数据归因与机制可解释性中以少量扰动识别高阶交互。