工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

Perplexity本地智能体基准测试超越Hermes与Pi

Perplexity表示,27B端侧模型与专用执行框架的组合,在知识型工作、网页搜索和文档解析测试中,超过了开源竞品执行框架

로컬 지식 작업 벤치마크 점수를 비교한 막대그래프

이미지: @perplexity_ai (X) 화면 갈무리

摘要

  • Perplexity表示,本地智能体"Portable Computer"搭载的27B端侧模型与专用执行框架组合,在知识型工作基准测试中超过了开源框架Pi与Hermes
  • 在网页搜索(BrowseComp)和文档解析(ParseBench-100)测试中,该组合也以更少的时间和token数取得更高分数,并说明除搜索环节外的其余处理全部在设备本地完成
  • Perplexity介绍称,通过仅在必要时经用户授权向前沿模型征询纯文本建议的方式,将Terminal Bench 2.1的得分从59.6%提升到了73.0%
발표
Perplexity, 2026-08-25 (X 리서치 스레드)
로컬 지식노동 벤치마크
포터블 컴퓨터+PPLX 27B 85.4% · +큐원3.8 27B 82.6% / Pi+큐원3.8 27B 77.6% / 헤르메스+큐원3.8 27B 74.0%
BrowseComp (1,266개 과제)
포터블 컴퓨터 66.7% vs Pi 50.2%, 헤르메스 43.9%
ParseBench-100 (문서 OCR)
포터블 컴퓨터 65.1% vs 헤르메스 34.6%, Pi 13.9%
프런티어 에스컬레이션 (Terminal Bench 2.1)
59.6% → 73.0%, 롤아웃당 0.415달러
하네스 구성
최소 시스템 프롬프트·온디맨드 스킬·CLI 커넥터(비 MCP)·자체검증·상시 샌드박스
PPLX 27B 후처리 학습
하네스 안에서 실사용 패턴 기반 합성 과제로 학습, 실사용자 데이터 미사용

击败开源执行框架的本地智能体

8月25日,Perplexity在此前以Perplexity推出无需云端、可在DGX Spark上运行的智能体为题公布的完全本地化智能体"Portable Computer"基础上,又在同一天发布了一份独立的研究帖,给出了更详细的基准测试数据。核心内容是:将27B级端侧模型与专用执行框架——即控制模型何时以及如何调用工具的运行框架——一并设计后,在实际知识型工作任务中,其表现超过了开源竞品执行框架Pi以及Nous Research的Hermes。Perplexity解释称,"小模型在为前沿模型设计的执行框架中会失败",因此他们针对模型规模重新设计了执行框架本身。

三个图形并排相连。左侧虚线框内的种子代表在设备本地运行的27B端侧模型,并通过实线箭头与中间的提示词形状执行框架相连——意味着执行框架始终掌控着模型的工具调用。执行框架与右侧的粗圆形(前沿模型)之间以虚线箭头连接,其上方有一个虚线圆圈关卡——表示只有当本地模型遇阻时,才会在获得用户授权后,向前沿模型征询纯文本建议。
이미지: @perplexity_ai (X)

同一模型,不同执行框架,分数天差地别

"Local Knowledge Work Bench"测试对53项任务各运行3次、共159次执行的结果格外引人注目。三种执行框架都使用了同一个Qwen3.8 27B模型,但得分差距明显。

执行框架 + 模型得分
Portable Computer + PPLX 27B(经后训练)85.4%
Portable Computer + Qwen3.8 27B82.6%
Pi + Qwen3.8 27B77.6%
Hermes + Qwen3.8 27B74.0%

Perplexity方面说明,即便使用相同模型,不同的执行框架设计也会带来最高8.6个百分点的差距;若再叠加针对特定用途做过后训练的PPLX 27B,分数还能进一步提升到85.4%。

이미지: @perplexity_ai (X)

搜索在外,其余在内

在衡量网页搜索能力的BrowseComp基准(共1,266项任务)测试中,Portable Computer取得66.7%的成绩,超过Pi(50.2%)和Hermes(43.9%),平均耗时约400秒,也短于Pi(约800秒)和Hermes(约1,000秒)。所用token数为852k,同样少于Pi的2.82M和Hermes的1.01M。在文档阅读基准ParseBench-100中,Portable Computer以65.1%大幅领先Hermes(34.6%)和Pi(13.9%),并且这一过程全部在设备本地完成,文档不会外传。也就是说,推理和个人文档留在本地,只有搜索环节会连接到网络。

基准测试Portable ComputerPiHermes
BrowseComp(1,266项任务)66.7%50.2%43.9%
ParseBench-100(文档OCR)65.1%13.9%34.6%
이미지: @perplexity_ai (X)

遇阻时,仅以文本形式请教前沿模型

当本地模型无法独立解决问题时,可在获得用户授权后向前沿模型征询建议。若涉及个人信息会有提示,且前沿模型无法直接访问文件或工具,只能返回纯文本指引。启用这一升级机制后,Terminal Bench 2.1的得分从59.6%提升到了73.0%,每次执行成本为0.415美元。Perplexity解释称,这相当于以三分之二的成本,弥补了与前沿模型之间约五分之三的差距。

이미지: @perplexity_ai (X)

为何要将模型与执行框架一同打造

Portable Computer的运行框架由极简系统提示词、按需调用的技能模块、以轻量CLI工具取代MCP服务器构建的连接器、模型自我核验结果的自检机制,以及常驻开启的沙箱环境构成。PPLX 27B正是在这一执行框架内,基于模拟真实使用模式的合成任务进行后训练,官方表示未使用真实用户数据。Perplexity表示,随着模型、芯片和设备性能的持续提升,本地优先方案的表现也会随之改善,并预告将很快公开本次使用的基准测试。

正如此前报道所述,Portable Computer是运行在NVIDIA DGX Spark之上的完全本地化版本,面向Perplexity Pro和Max订阅用户开放。此次研究则为其性能表现补上了详细数据支撑。

이미지: @perplexity_ai (X)

编辑视角

Perplexity特意让同一模型(Qwen3.8 27B)在三种执行框架下运行对比,传递的信息很明确——用数据证明"决定性能的是执行框架,而非模型本身"。这也是一次直接针对开源阵营Pi和Nous Research旗下Hermes的比较,释放出本地智能体竞争正从"模型规模之争"转向"运行框架设计之争"的信号。结合近期传出英伟达正与Perplexity洽谈以约300亿美元估值进行投资的消息来看,不难理解Perplexity为何要打造一套针对DGX Spark这一特定硬件优化的执行框架。

把27B级模型投入实际业务时,常会撞上同一堵墙——它不如云端前沿模型聪明,一旦工具调用稍微复杂一点就容易迷失方向。Portable Computer展示的思路是:不去扩大模型规模,而是围绕模型体量重新设计执行框架;再叠加"仅在必要时以文本形式请教前沿模型"的升级机制,便以低得多的成本弥补了相当一部分差距。对于不愿把整份文档上传云端的法务或医疗团队来说,这种架构或许能成为云端智能体之外的一个选项。

不过,所有这些数据都是在DGX Spark这一特定硬件上跑出来的,普通笔记本电脑或手机上能否复现同样的性能,则是另一回事。既然官方表示将很快公开基准测试,预计接下来几周内会有外部开发者陆续尝试复现并验证这些数据。

评论