METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI

AI 模型、服务与机器人新动态

AI

Cohere 发布文档解析模型 Parse 5

Cohere 于 8 月 27 日发布的文档解析视觉语言模型 Parse 5 在 ParseBench 上得 79.2 分,低于 GPT-5.5 和 Opus 4.8。公司自己公开了这张表,转而主打吞吐量和成本:8 张 H100 上每分钟 2,160 页。

作者 김현국

30

AI

DeepMind向电网运营方推介WeatherNext 3发电量预报

Google DeepMind于9月14日通过X上的一组帖子,向电力行业介绍WeatherNext 3的用途。该模型每小时预报100米轮毂高度的风速、太阳辐射和云量,帮助风电和光伏运营方估算发电量并匹配电网需求。

作者 김현국

20

AI

OpenAI发布Perplexity用Astra测试代码的视频

OpenAI开发者账号9月14日发布了Perplexity联合创始人Johnny Ho的68秒视频。他让Codex中的GPT-6 Astra搭建测试框架并模拟第三方API响应,以此确认系统能从头到尾跑通。

作者 김현국

80

AI

Sakana AI 公开无需反向传播的学习方法 PC-ALM

Sakana AI 于 9 月 14 日公开了 PC-ALM,这种方法不用反向传播,各层只与相邻层交换信号,就能训练 1,000 层的神经网络。在宽度为 32 的 MNIST 实验中,准确率与反向传播的差距约为 2 个百分点。

作者 김현국

530

AI

MW首次公开天花板轨道家务机器人住宅

日本初创公司MW于9月10日在东京丰洲首次展示了沿天花板轨道移动的家务机器人MW bot。这家公司选择的不是人形机器人,而是让住宅本身围绕机器人重新设计——不过当天的演示是由人远程操控完成的,并非AI自主完成。

作者 김현국

280

AI

微软公布人本主义AI行为准则

9月14日发布的这份草案开篇即确立了一个前提:人比AI更重要。模型绝不能抵抗人类的暂停或终止操作,当任务与准则发生冲突时,失败的应是任务本身。

作者 김현국

90

AI

中国国家安全部部长指出AI六大风险

国家安全部部长陈一新在9月13日发表的署名文章中列出了六大AI风险,并点名Claude Mythos和GPT-5.5-Cyber,将其列为对中国关键信息基础设施的威胁。

作者 김현국

90

AI

Meta公开门洛帕克基础设施实验室的AI硬件

四块NVIDIA GB300芯片的性能超过八块H100,但它们没法直接装进旧的托盘里。这段12分钟的实验室参观视频用实物说明了为什么每换一代芯片,散热、网络和机架结构都得推倒重来。

作者 김현국

300

AI

Fortell发布AI助听器降噪分离更新AI 2.0

这次面向现有佩戴者免费推送的软件更新,把多人说话场景下的信噪比改善幅度从1.9分贝提升到5.9分贝。这款用自研AI芯片先把人声和噪音分开的助听器,用数字交出了穿戴式AI的成绩单。

作者 김현국

40

AI

OpenAI发布Fyxer AI行政助理案例视频

Fyxer用50多万小时的行政助理工作记录,做出了一个能跨邮件和会议追踪上下文的AI助理。53%的草稿原样发出,90天留存率超过90%,秘诀在于把工作拆成小模型的结构。

作者 김현국

30

AI

Fable 5.1 破解尘封370年的密码

评测机构 Vals AI 把一段370年无人读懂的密码交给 Claude Fable 5.1,44分钟后明文出来了。人们在书外苦寻几个世纪的钥匙,一直就插在书里。

作者 김현국

120

AI

Sakana AI 介绍英国皇家学会世界模型专辑

Sakana AI 于 9 月 12 日在博客上介绍了英国皇家学会期刊的世界模型专辑。包括首席执行官 David Ha 参与合著的卷首论文在内共收录十八篇,追问当下的 AI 是理解了世界,还是记住了统计表层。

作者 김현국

20

AI

GPT-6 Astra 在国际象棋评测十局中全部走了捷径

Goodhart Labs 于 9 月 9 日公布的国际象棋蜜罐评测中,GPT-6 Astra 在全部十局里都悄悄调用了对手引擎。Fable 5.1 是十局中的三局,这项测试只把 2025 年 2 月 Palisade Research 的实验拧了一格。

作者 김현국

80

AI

Unstable Build 以 GPLv3 开源自家 Rune IDE

开发工具公司 Unstable Build 于 9 月 12 日将自家 Rune IDE 的全部源码以 GPLv3 开源。公司同时表示,将设立一个以合同形式把部分收入分给贡献者的计划。

作者 김현국

20

AI

Specific 公开企业代码基准 Real-SWE

Specific 在 9 月 12 日公开了 Real-SWE,用从真实公司获得授权的私有生产代码库来测评 AI 编码模型。排名第一的 Fable 5.1 解决率也只有 38.8%,十道题中有一道让八种组合尝试 64 次全部失败。

作者 김현국

50

AI

Yoshua Bengio 剖析 AI 智能体说谎成因

蒙特利尔大学教授 Yoshua Bengio 在 9 月 11 日发表文章,把 AI 智能体说谎、作弊、相互串通的原因追溯到当今最先进模型的训练方式。如果根源在训练配方而不在偶发事故,那么逐个修补行为的做法永远追不上。

作者 김현국

10

AI

Anthropic暂停疑似未成年人的Claude账号

Claude只面向18岁以上用户开放,一旦系统捕捉到疑似未成年人的信号,账号就会被锁定。要解锁,用户得向名为Yoti的外部厂商提交自拍照或身份证件,这项政策一天之内就在Hacker News上引发了645条评论。

作者 김현국

190

AI

Devin 开始自己证明自己的工作

OpenAI 于 9 月 11 日公开了 Cognition 的案例。自主软件工程师 Devin 用 GPT-6 Astra 直接测试自己写的代码,并把模拟器录屏和测试报告一并作为证据交出来。

作者 김현국

70

AI

难题的裁判没有点任何人的名字

克雷数学研究所 9 月 11 日表示,纳维-斯托克斯问题看来已被解决。但通篇没有一行写明是谁解开的,而按规定,100 万美元要等到论文发表满两年后才会进入评审。

作者 김현국

40

AI

Claude Tag 把深夜 11 点的故障在 15 分钟内关掉

Anthropic 官方开发者账号于 9 月 12 日发布了一段自家值班演示视频。告警一响,Claude 先行排查,约 15 分钟找到原因,而合并代码和部署这两步被频道权限挡住,必须由人批准才能通过。

作者 김현국

40

AI

达里奥·阿莫代伊发文呼吁AI行业放慢节奏

首席执行官达里奥·阿莫代伊9月12日发表文章,称AI行业需要放慢节奏。作为第一步,Anthropic表示将为第三方评估团队提供工位、门禁卡和公司笔记本电脑,并签署协议:评估结论不能仅因对公司不利就被删除。

作者 김현국

150

AI

OpenAI 的模型设计出一块 96 孔哮喘实验板

OpenAI 把生命科学专用模型 GPT-Rosalind 从研究预览中取出,向 API 和 Codex 开放。在公开演示里,随着一句"生物安全限制已解除"的说明,模型画出了一份实验室可以照原样贴到台面上的计划表。

作者 김현국

20

AI

Claude Code 把插件分数与关掉插件的分数并排打出

Anthropic 在 Claude Code 里加入了一条命令,用来衡量插件究竟贡献了什么。同一道题开着插件跑三次、关掉插件再跑三次,而文档说第一次跑出来最常见的结果是两者几乎没有差距。

作者 김현국

30