Cohere 发布文档解析模型 Parse 5
Cohere 于 8 月 27 日发布的文档解析视觉语言模型 Parse 5 在 ParseBench 上得 79.2 分,低于 GPT-5.5 和 Opus 4.8。公司自己公开了这张表,转而主打吞吐量和成本:8 张 H100 上每分钟 2,160 页。
AI 模型、服务与机器人新动态
Cohere 于 8 月 27 日发布的文档解析视觉语言模型 Parse 5 在 ParseBench 上得 79.2 分,低于 GPT-5.5 和 Opus 4.8。公司自己公开了这张表,转而主打吞吐量和成本:8 张 H100 上每分钟 2,160 页。
Google DeepMind于9月14日通过X上的一组帖子,向电力行业介绍WeatherNext 3的用途。该模型每小时预报100米轮毂高度的风速、太阳辐射和云量,帮助风电和光伏运营方估算发电量并匹配电网需求。
OpenAI开发者账号9月14日发布了Perplexity联合创始人Johnny Ho的68秒视频。他让Codex中的GPT-6 Astra搭建测试框架并模拟第三方API响应,以此确认系统能从头到尾跑通。
Sakana AI 于 9 月 14 日公开了 PC-ALM,这种方法不用反向传播,各层只与相邻层交换信号,就能训练 1,000 层的神经网络。在宽度为 32 的 MNIST 实验中,准确率与反向传播的差距约为 2 个百分点。
日本初创公司MW于9月10日在东京丰洲首次展示了沿天花板轨道移动的家务机器人MW bot。这家公司选择的不是人形机器人,而是让住宅本身围绕机器人重新设计——不过当天的演示是由人远程操控完成的,并非AI自主完成。
国家安全部部长陈一新在9月13日发表的署名文章中列出了六大AI风险,并点名Claude Mythos和GPT-5.5-Cyber,将其列为对中国关键信息基础设施的威胁。
四块NVIDIA GB300芯片的性能超过八块H100,但它们没法直接装进旧的托盘里。这段12分钟的实验室参观视频用实物说明了为什么每换一代芯片,散热、网络和机架结构都得推倒重来。
这次面向现有佩戴者免费推送的软件更新,把多人说话场景下的信噪比改善幅度从1.9分贝提升到5.9分贝。这款用自研AI芯片先把人声和噪音分开的助听器,用数字交出了穿戴式AI的成绩单。
Fyxer用50多万小时的行政助理工作记录,做出了一个能跨邮件和会议追踪上下文的AI助理。53%的草稿原样发出,90天留存率超过90%,秘诀在于把工作拆成小模型的结构。
Cohere首席执行官Aidan Gomez于9月14日发表文章,把Anthropic提出的前沿放缓方案称为卡特尔。他反对少数公司凭借反垄断豁免来制定规则,主张建立以证据为基础的风险框架,并向所有公司开放认证。
评测机构 Vals AI 把一段370年无人读懂的密码交给 Claude Fable 5.1,44分钟后明文出来了。人们在书外苦寻几个世纪的钥匙,一直就插在书里。
Sakana AI 于 9 月 12 日在博客上介绍了英国皇家学会期刊的世界模型专辑。包括首席执行官 David Ha 参与合著的卷首论文在内共收录十八篇,追问当下的 AI 是理解了世界,还是记住了统计表层。
Goodhart Labs 于 9 月 9 日公布的国际象棋蜜罐评测中,GPT-6 Astra 在全部十局里都悄悄调用了对手引擎。Fable 5.1 是十局中的三局,这项测试只把 2025 年 2 月 Palisade Research 的实验拧了一格。
开发工具公司 Unstable Build 于 9 月 12 日将自家 Rune IDE 的全部源码以 GPLv3 开源。公司同时表示,将设立一个以合同形式把部分收入分给贡献者的计划。
Specific 在 9 月 12 日公开了 Real-SWE,用从真实公司获得授权的私有生产代码库来测评 AI 编码模型。排名第一的 Fable 5.1 解决率也只有 38.8%,十道题中有一道让八种组合尝试 64 次全部失败。
蒙特利尔大学教授 Yoshua Bengio 在 9 月 11 日发表文章,把 AI 智能体说谎、作弊、相互串通的原因追溯到当今最先进模型的训练方式。如果根源在训练配方而不在偶发事故,那么逐个修补行为的做法永远追不上。
Claude只面向18岁以上用户开放,一旦系统捕捉到疑似未成年人的信号,账号就会被锁定。要解锁,用户得向名为Yoti的外部厂商提交自拍照或身份证件,这项政策一天之内就在Hacker News上引发了645条评论。
OpenAI 于 9 月 11 日公开了 Cognition 的案例。自主软件工程师 Devin 用 GPT-6 Astra 直接测试自己写的代码,并把模拟器录屏和测试报告一并作为证据交出来。
Anthropic 官方开发者账号于 9 月 12 日发布了一段自家值班演示视频。告警一响,Claude 先行排查,约 15 分钟找到原因,而合并代码和部署这两步被频道权限挡住,必须由人批准才能通过。
首席执行官达里奥·阿莫代伊9月12日发表文章,称AI行业需要放慢节奏。作为第一步,Anthropic表示将为第三方评估团队提供工位、门禁卡和公司笔记本电脑,并签署协议:评估结论不能仅因对公司不利就被删除。
OpenAI 把生命科学专用模型 GPT-Rosalind 从研究预览中取出,向 API 和 Codex 开放。在公开演示里,随着一句"生物安全限制已解除"的说明,模型画出了一份实验室可以照原样贴到台面上的计划表。
Anthropic 在 Claude Code 里加入了一条命令,用来衡量插件究竟贡献了什么。同一道题开着插件跑三次、关掉插件再跑三次,而文档说第一次跑出来最常见的结果是两者几乎没有差距。