研究电子表格分析AI测试中Claude Opus 5以54%领先Artificial Analysis公开了新的智能体基准AA-AnalystAgent。57%的失败源于对最初假设的执念。作者 김현국/3 天前00
模型Together AI公布DeepSeek与GPT-5.6 Luna级联测试结果在DeepSWE基准测试中,DeepSeek优先级联方案解决的任务数量超过Luna单独运行作者 METAL 뉴스룸/2026.08.0900
产品OpenAI 联合 AWS、Cursor、GitHub 等发布智能体插件标准将 Agent Skills 与 MCP 服务器配置整合为统一格式,实现跨多个智能体客户端复用作者 METAL 뉴스룸/2026.08.0900
产品Prime Intellect发布自我改进型智能体框架"Prime Agent"面向编程与长时运行自主任务的RLM框架,主打可自我修改框架状态的结构作者 METAL 뉴스룸/2026.08.0910