
图片:METAL
摘要
- V7 Go 用 GPT-5.6 Luna 扫过数百万份文件填充 Context Graph,再基于这张图运行 MCP 检索和长达数百步的工作流。
- 在极难档的图谱查询上,GPT-6 Astra 为 89%,GPT-5.6 Sol 为 78%,而从简单到困难三档两个模型都接近 100%。
- 公司表示,资产管理机构的交易筛查快了 21 倍,保险团队把理赔处理错误降低了 13.5%。
OpenAI 于 9 月 21 日公开了初创公司 V7 的案例。主角是把散落在公司各处的文件变成智能体可查询上下文的 V7 Go,同时还给出了一个数字:GPT-6 Astra 在最难的一组图谱查询上取得 89% 的准确率。在同一套测试的极难档,GPT-5.6 Sol 为 78%。
公告这样界定问题。今天的模型能够推理复杂任务,却无法自动理解这些任务所处的业务脉络。哪份基金报告是最新的,同一家企业在三套系统里各自被写成什么名字,都属于这一类。这些脉络散落在文档、数据室、电子表格、邮件和内部工具里,既未被整理,对智能体也不可见。
V7 由 Alberto Rizzoli 和 Simon Edwardsson 于 2018 年创立。两人此前共同做过一款被广泛使用的计算机视觉无障碍应用,创办 V7 是为了帮助企业教会 AI 系统自家业务如何运转。目前的主力产品是用于搭建关键业务工作流的智能体平台 V7 Go。
架构分为两层。GPT-5.6 Luna 从数百万份文件中抽取信息并整理进 Context Graph,这张图连接实体、关系与引用证据,支撑 MCP 检索和可复用的工作流。单个工作流可以延伸到数百步。需要更多推理和工具调用的多步指令交给 GPT-5.6 Terra 和 Sol,而横跨数千份文档的财务分析这类负担最重的图谱查询,公司已开始交给 GPT-6 Astra。
公司方面表示,当上下文、模型和工具咬合在一起,智能体能在几分钟内完成 50 到 100 步的工作流,准确率达到 99.9%,并为每一次决策留下可审计的记录。V7 联合创始人兼 CEO Alberto Rizzoli 说:"要解决金融和保险领域的困难企业场景,AI 需要像学习互联网那样学会你的业务如何运转。"
从工程视角看,这套设计针对的浪费很清楚。没有图谱,智能体每次收到请求都得从头重新寻找脉络,几十次检索耗掉时间和 token,却仍常常漏掉埋在关系里的关键信息。V7 Go 连接 SharePoint、Google Drive 等存储库,扫描其中的实体、关系、事实、属性和指标来填充图谱,公告写道,遍历这张图比长上下文方案便宜且快一个数量级。
新文件进来时,V7 Go 会识别本体中的公司、基金、人物等实体,把每条事实接到已有或新建的记录上,并保留回溯到原始出处的引用证据。图谱里信息不足时,它还能用 RAG 直接检索底层文档。对于长时间运行的智能体,最近的往来留在模型的活跃上下文里,较旧的材料沉入图谱,需要时再取出。
结构对性能的影响也单独做了测量。在衡量跨企业系统查找并串联信息能力的 HERB 基准上,公司表示其纯检索系统比官方基线高出 69%,并把无解查询上的幻觉减少了 38%。METAL 核实,HERB 是 Salesforce AI Research 于 2025 年 6 月发布的基准,在取自文档、会议记录、Slack 消息、GitHub 和 URL 的 39,190 份企业产物上抛出多跳问题。论文写道,即便表现最好的智能体式 RAG 方法平均也只有 32.96 分,瓶颈在检索。
客户侧的数字也一并公布。资产管理机构的交易筛查比过去快 21 倍,把原本一整天的流程压缩到 15 分钟;某金融服务团队把审阅时间从 100 多小时降到 10 小时以内,每项任务节省 12,000 美元的专家成本。某保险团队在让智能体掌握全部历史理赔和现行保单知识后,把理赔处理错误相对人工基线降低了 13.5%。
公告里的演示是私募股权交易筛查。工作流从名为机密信息备忘录的交易文件中抽出关键财务数据、交易条款、管理层信息和带引用的风险字段,再生成一份筛查说明。公司表示,保险核保也按同样方式运转。
模型的选用按档位划分。在 AI 生成的工作流中,V7 Go 把每一步分配到快速、中等和智能三档。结构化抽取和大批量处理由 GPT-5.6 Luna 承担,对话、Go Agent 路径以及需要更多推理或工具调用的步骤则交给 GPT-5.6 Terra 或 Sol。
V7 联合创始人兼 CTO Simon Edwardsson 用性能数字解释了这个选择。他说:"我们把 OpenAI 选作默认,因为它在 V7 Go 所依赖的多步工具工作流上表现最好。"他补充道,在公司自建的 Context Graph 基准上,工具调用错误率从 GPT-5.5 的 2.7% 降到 GPT-5.6 Sol 的 0.2%。他还表示,Terra 让团队砍掉了许多只为帮模型简化任务而存在的中间环节,仅此一项就省下数天的交付工作。
其余的效率数字集中在管道层面。在 V7 最新的执行框架里,带多次外部调用的关键工作流最多快了 50%;GPT-5.6 Luna 的单份文档成本比 GPT-5.4 mini 低 78%。V7 把文档密集的 V7 Go 负载从 Chat Completions API 迁到 Responses API,其自测显示,部分 PDF 密集工作流的 token 用量下降约 5%,缓存可靠性也有改善。公告还提到,OpenAI 在数小时内批准并落实了扩容需求,而其他供应商需要数周。
89% 这个数字之所以出现,是因为基准已经饱和。GPT-5.6 Sol 把既有测试大多填到接近满分,于是 V7 用横跨数千份文档、更杂乱的真实数据重新构造了一组困难的图谱查询。这套数据集有四个难度档,简单、中等和困难三档两个模型都接近 100%,只有在极难档才分出 78% 与 89%。METAL 在 GPT-6 Astra 发布时报道过,对齐改进与关键能力评级是同时到来的。
对外的通道是 MCP。V7 Go 通过自家 MCP 服务器开放 Context Graph 的查询与写入,客户可以直接在 ChatGPT 及其他兼容客户端中使用,也可以在 Codex 里通过 MCP 创建 V7 Go 工作流。加上工作流设计本身变简单,搭建一条中等长度工作流所需的时间从一小时左右降到 20 分钟上下。
把智能体接到公司数据上的尝试贯穿了今年。METAL 报道过 OpenAI 推出了回答公司数据问题的智能体,当时的胜负手同样不是模型性能,而是通往内部资料的路径。V7 在自家产品页上打出的句子指向同一处:即便最好的 LLM 也止步于 100 万 token 的上下文窗口,而一家机构握着 15 年的交易历史,会话一结束模型就把这一切忘光。同一页面还列出了 300 多项集成和 120 多个智能体。
下一个目标是让图谱先动起来。V7 团队正朝着这样的方向推进:Context Graph 中的事实发生变化时工作流自行启动,标出前后不一致之处,并告诉人们哪些分析需要重看。比如某份基金报告被重述后,V7 Go 会指出那些仍然建立在旧数字上的工作。
这个案例显示的是,智能体竞争的轴心正从模型移向记忆。如果同一个模型会因公司材料的组织方式不同而产生不同结果,那么被定价的资产就不是模型使用权,而是整理好的上下文。Rizzoli 说:"从 AI 中获得真正价值的金融机构,不会是智能体最多的那些,而会是上下文最好的那些。"





评论