OpenAI发布Basis的GPT-6 Astra应用案例
AI会计初创公司Basis使用GPT-6 Astra完成一份50个标签页的税务工作簿,用时仅为GPT-5.6 Sol的一半。任务进行中调整推理量时缓存仍能保持,内部评估分数提高了约20%。
标签
AI会计初创公司Basis使用GPT-6 Astra完成一份50个标签页的税务工作簿,用时仅为GPT-5.6 Sol的一半。任务进行中调整推理量时缓存仍能保持,内部评估分数提高了约20%。
OpenAI将缓存折扣的重复使用窗口定为30分钟,并推出了显示命中率的仪表盘和缓存未命中诊断工具。缓存写入费用是输入单价的1.25倍,命中率因此直接决定成本。
OpenAI 推出了两款以与 GPT-6 Astra 相近方法训练的模型。相比 GPT-5.6 的促销价,API 价格下调一半;在业务自动化评测中,每项任务的成本比 Claude Opus 5 低十倍以上。
OpenAI 于 9 月 21 日公开了初创公司 V7 的案例。主角是把公司文件变成智能体可查询上下文的 V7 Go,GPT-6 Astra 在最难的图谱查询上取得了 89% 的准确率。
9月16日,OpenAI 发布了一套框架,规定何时以及如何公开其模型中发现的失准案例,并同时发布了过去六个月的六份事件报告。任何员工都可以提交案例,每一步都有时限,案例分为三条通道。背后是公司自己的判断:对齐问题尚未充分解决。
ChatGPT官方账号9月15日宣布,GPT-5.5将于10月14日从ChatGPT、ChatGPT Work和Codex的所有套餐中下线。OpenAI开发者账号随即明确划清界限,表示通过API以及使用API密钥验证的Codex会话仍可继续使用该模型。
AI 监督组织 The Midas Project 于 9 月 10 日发布分析,指出 OpenAI 的 GPT-5.6 Preview、GPT-5.6 和 GPT-6 Astra 系统卡中缺少加州法律要求的失控风险等级。OpenAI 回应称对合规有信心。
Specific 在 9 月 12 日公开了 Real-SWE,用从真实公司获得授权的私有生产代码库来测评 AI 编码模型。排名第一的 Fable 5.1 解决率也只有 38.8%,十道题中有一道让八种组合尝试 64 次全部失败。
186个国家、4.7万人提交了超过8000个项目,OpenAI在8月25日公布了各赛道的8个获奖作品。冠军团队中有四支,其中两支的成员分别是没有编程经验的兽医和心脏内科医生。
美国国债收益率急剧上升,威胁到亚洲AI股价的上涨势头,与此同时,AMD发布新一代服务器芯片,GPT-5.6大幅降价,开源模型与基础设施的讨论也贯穿全天。
已经是最后一篇了。