A Virtual Member of a Community of Practice for the Society of Petroleum Engineers: From Prototype to Deployment
面向石油工程师社区的AI助手ATHENA,从原型走向实际部署
ATHENA是为石油天然气行业专业社区打造的聊天式AI助手,能准确检索信息、捕捉现场经验知识并根据用户水平主动推送有用提示。此前一次涉及75名石油工程师学会(SPE)专业人士的评估显示,相比当时最先进的RAG(检索增强生成)基线系统,ATHENA将任务得分提高152%、生产力提高283%;本文进一步加入多文档检索、答案验证和更精准的知识推送功能,后续对13名非专家用户的评估显示,相较同类基线系统,任务得分提升216%、失败率降为零、生产力提升215%,目前该系统已开始在SPE研究门户上部署。
他们做了什么
- 团队为石油天然气行业专业社区打造ATHENA,在同一个聊天界面中完成答疑、捕捉一线经验知识(insight)、并根据用户专业水平和当前任务主动推送相关知识。
- 不同于传统RAG系统仅依赖关键词或向量嵌入检索,ATHENA将用户问题改写成多种表述,并按地点、主题、文档类型打标签作为过滤条件,使检索准确率指标(MRR)达到0.687,高于两个对比嵌入模型的0.412和0.376。
- 新增的'批量文档阅读'代理可以从数十至上百份文档中汇总分散信息,配合可定位到具体页码和引文的文档查看器,提升了答案的可核实性。
- 团队构建了包含超过20万个条目的'用户能力向量',用于建模每位用户在各主题上的专业程度,使相关知识推送的排序指标(MRR)相比旧方法提升500%,所需筛选的推送条数减少84%。
- 在13名非专家参与的评估中,相较最先进的RAG基线系统,ATHENA的平均任务得分提高216%、任务失败率下降100%、生产力提高215%、可用性评分(KM-SUS)提高28%;系统已于2025年6月向25名早期用户在SPE研究门户部署,计划2025年第四季度向全体会员推广。

为什么重要
这项工作展示了一个面向特定行业、需要处理海量文档和专家经验知识的AI助手,如何从实验室原型真正走进一个拥有13.2万会员的专业学会日常使用中,较为少见。对于开发或评估检索类AI工具的人来说,它说明验证功能、跨多文档信息整合以及与机构建立信任的过程,和底层AI技术本身同样重要。

本文术语
- RAG(检索增强生成) · 先检索相关文档,再依据文档内容生成答案的AI方法
- MRR(平均倒数排名) · 衡量正确文档在检索结果中排名高低的指标,数值越高越好
- 嵌入(embedding) · 将文字转换成数值向量,使语义相近的内容在向量空间中彼此靠近的方法
- 代理式(agentic)方法 · 由多个分工不同的AI代理协作完成任务,而非单一模型独立完成的系统设计
- KM-SUS · 专门为评估知识管理系统可用性而新开发的评分量表
论文原文摘要(英文)
We describe the evolution of a virtual assistant, called ATHENA, designed to support the capture, retrieval, and dissemination of knowledge for members of a Community of Practice (CoP) related to the Oil and Gas sector. An evaluation of a first prototype involving 75 professionals from the Society of Petroleum Engineering (SPE) showed that ATHENA dramatically improved both their productivity and performance equality on a set of realistic well-planning tasks compare to their use of a state-of-the-art RAG baseline system. However, the evaluation also identified areas for improvement. This paper describes technical advances to our first prototype in the areas of multi-document retrieval, support for answer validation, and more focused proactive dissemination. Evaluation results show that this enhanced version of ATHENA provides better support for completing knowledge-intensive tasks related to well planning than does a state-of-the-art baseline. ATHENA has been integrated into the SPE Research Portal and is being deployed for use by the society's membership.
在 arXiv 阅读最新论文
- LoRA-GA$^2$: Low Rank Adaptation with Multi-step Gradient Adaptive Alignment在正式微调前先偷看几步训练的梯度,让LoRA的初始化更聪明
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI助手在该向你提问的时候,却更愿意自己去核实事实
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction文本信息缺失或损坏时,这个AI不靠一次性猜测,而是反复修正猜测结果,从而更准确地判断情绪
- Generating Diverse Personas for User Simulators to Test Interview Dialogue Systems要测试访谈式对话系统需要大量不同性格的虚拟用户,这项研究用大语言模型自动生成这些虚拟用户人设
- Rethinking Patch Based Multivariate Time Series Forecasting with Semantic Structured Partitioning别再机械切分时间序列,按语义把它切成有意义的块
- Reliable Financial Named Entity Recognition under Domain ShiftAI在正式文件里学到的自信,一到推特上就变得不可信
- Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis让AI分析脑影像数据时,把“为什么这个结论可信”也一并记录下来
- GenMatch: An End-to-End Generative Matching Framework for Micro-View Order-Dispatching in Ride-Hailing滴滴把打车派单从预测-计算-匹配三段式流程改成一次生成完成,线上效果提升明显
METAL LAB 最新报道
图片来源: John Boden et al., arXiv:2608.19199, arxiv-nonexclusive