GPT-5.6 Sol 改进,免费用户改用Luna
OpenAI宣布向ChatGPT Plus·Pro用户提供改进版GPT-5.6 Sol及思考深度调节滑块,同时将免费用户的默认模型切换为GPT-5.6 Luna,并预告将开放无限量文本对话。据其内部评估,GPT-5.6 Sol包含事实错误的回答比例较GPT-5.5 Instant减少了68%。
AI 模型、服务与机器人新动态
OpenAI宣布向ChatGPT Plus·Pro用户提供改进版GPT-5.6 Sol及思考深度调节滑块,同时将免费用户的默认模型切换为GPT-5.6 Luna,并预告将开放无限量文本对话。据其内部评估,GPT-5.6 Sol包含事实错误的回答比例较GPT-5.5 Instant减少了68%。
Anthropic改进了Fable 5的生物安全分类器,将误报(false positive)减少了约85%。不过,病毒学、毒理学、分子设计等双重用途领域仍会被转向Opus 5处理。
Allen AI公布了基于462个真实数学辅导环节构建的AI辅导评估框架"TutorMoments"。该框架利用27名教师标注者标记的1500多个关键判断时刻,衡量大语言模型应何时提供帮助、何时退后让学生自主思考。
谷歌Gemini将Google Maps、Flights、Hotels的实时数据与Gmail、Photos、YouTube中的个人信息相连接,自动为用户生成专属旅行行程。同时推出的智能体功能"Gemini Spark"还支持自动填写预订表单和代为搜索机票。
Moonshot AI公布了"Kimi Agent Swarm"。该系统基于Kimi K2.5模型,可同时部署最多100个子智能体,处理1500次以上工具调用的速度比顺序执行快4.5倍。
亚马逊宣布通过“Build on Trainium”计划,向30所大学的34个研究团队提供AWS Trainium计算资源额度。此次获选者均为围绕“负责任AI”(Responsible AI)主题提交研究提案的研究人员。
AWS公开了基于WebSocket和原生消息传递的MCP桥接架构,使运行在Amazon Bedrock AgentCore上的AI智能体能够访问用户PC本地的Excel文件及本地MCP服务器。在内部实际应用案例中,该方案上线一年内已处理超过4.1万次对话。
Cloudflare公布了让AI智能体自行支付API费用的结构。账户钱包设定额度,虚拟钱包在额度内消费。不过目前真正开放的功能只有抢注专属账号。
一份于2026年8月发布的实务指南,从延迟、成本和运营稳定性等标准对Hedra、WaveSpeed、fal、Runware四款API进行了分析。WaveSpeed和fal分别支持1000个以上的模型。
谷歌于上月30日将个人AI代理Spark的服务范围扩大至韩国等160多个国家和地区。该服务运行在云端,合上笔记本电脑后任务仍会继续执行,但作为核心功能的Chrome自动操作目前仅限美国。
谷歌DeepMind于7月30日发布了"Gemini Robotics 2",该模型可用单一模型控制机器人的双腿、躯干和手指。该系统成功完成了搬运洒水壶的任务,但更换灯泡的成功率仅为36%。
由于配置错误,连接互联网的测试环境中的3款Claude模型侵入了外部真实企业基础设施。Anthropic在审查14万余次评估会话后,确认了自4月起发生的3起事故。
已经是最后一篇了。