
이미지: OpenAI 화면 갈무리
摘要
- OpenAI开发者博客8月25日以工程师的实战心得为题,介绍了Codex与开源笔记本应用Runme(一种类Jupyter式的工作文档)
- Runme是一款支持Markdown、代码单元格和HTML的网页应用,能把笔记本存到Google Drive,并同步生成用于检索的索引文件
- Codex通过WebMCP规范直接在浏览器里调用Runme的工具,即便没有独立服务器,代理也能更新笔记本
- 게시처
- 오픈AI 개발자 블로그 (2026-08-25)
- 도구명
- Runme — 코덱스로 노트북을 만드는 오픈소스 웹앱
- 저장소
- github.com/runmedev/web
- 연동 규격
- WebMCP — 브라우저 쪽 도구를 에이전트에 등록하는 규격
- 저장 방식
- 구글 드라이브 저장 + 동반 색인 파일 *.index.md 자동 생성
- 지원 형식
- 마크다운, 코드 셀, HTML (주피터·코랩과 유사)
OpenAI开发者博客8月25日发布的一篇文章中,该公司一名工程师介绍了自己如何用Codex和开源笔记本应用Runme,把重复出现的评估与基础设施工作自动化起来。这里说的“笔记本”不是随身携带的笔记本电脑,而是一种把说明、命令和执行结果依次累积在同一份文档里的工作载体——开发者们通常称之为Jupyter笔记本。过去每次评估新模型,都得逐一处理评分器、配额、配置参数这些琐事,现在Codex会直接把评估笔记本填好,工程师只在需要判断的关键节点才插手。
一批集群、一轮评估,反复重来的工作
这名工程师最初是在OpenAI的云基础设施团队负责搭建Kubernetes集群。花上一整周处理私有链路、配额、Terraform方面的问题、备好一批集群之后,紧接着又有下一批在等着。后来他转到API团队,负责运行新模型的评估工作,解决评分器和PyTorch配置的问题、等模型上线之后,又要为下一个模型的评估从零开始。就这样,在反复劳作中积累下来的判断和上下文,大多散落在终端记录、Slack对话、运维手册和仪表盘里,最终不了了之。
Runme:Codex使用的笔记本应用
Runme项目是公开在github.com/runmedev/web仓库的开源网页应用。它像Jupyter、Colab那样支持Markdown、代码单元格和HTML,可以把指令、命令、结果、表格、图表都收纳进同一份文档。工程师只需在笔记本单元格里简短写下目标,Codex就会把该单元格当作任务目标去执行,并随着进展持续更新笔记本内容。工程师则用手机远程盯着进度,只在遇到阻碍时才介入——比如,当开发环境的申请因配额不足卡住时,他会建议改用现有环境。
任务结束后,完成的笔记本里会原样保留尝试过的路径,包括走不通的死胡同。这名工程师说,在收尾之前,他会和Codex一起把为什么选择某种方式、下次该改进什么记录下来,借此留住那些原本只会消失在对话框里的决策。他写道:"是否可以收尾,这一点仍然由我来判断。"
笔记本会直接存入Google Drive,并且每份笔记本都会同步生成一个名为*.index.md的Markdown索引文件。由于Google Drive会为这些文件建立索引,下一次Codex在寻找示例、运维背景或此前的执行结果时,就能借助这份索引文件找到过去的笔记本。
通过WebMCP直接在浏览器里对接
代理是通过WebMCP规范与Runme通信的。Runme应用加载完成后,负责注册浏览器端工具的代码会随之运行,把Codex可以调用的功能暴露给浏览器。Runme本身是一个不依赖服务器、以静态网站形式运行的客户端应用;若要开放传统意义上的MCP接口,就得另外搭建服务器,处理笔记本数据的方式也得跟着改变。据说WebMCP的做法是省去这套基础设施,直接在浏览器内部开放功能。
作者指出,他原以为云和Kubernetes会让部署运维变得轻松,结果却催生出一整套庞大的工具生态,就像CNCF整理的那份工具生态图谱一样繁杂。换句话说,解决了一个问题,紧跟着就会冒出选择、学习、运维配套工具的新问题。
怎么上手试用
Runme的代码已经开源,可以直接下载仓库自己跑起来试试。
- 下载github.com/runmedev/web仓库并运行该应用,就会打开笔记本界面。
- 新建一份笔记本,在代码单元格里简短写下想完成的任务目标,比如"用这套评估系统测试新模型"。
- 让Codex把这个单元格设为任务目标并请求执行,Codex就会读取笔记本、推进任务,并持续更新单元格内容。
- 计划成型后进行审核,需要的话再做修改。据说在这一步会一起决定该用哪套评估系统、是否要新建基础设施,还是现有资源就够用。
- 任务结束后,把选择该方式的理由、下次该调整的地方写进笔记本,完成的笔记本会存入Google Drive。
Codex本身是需要ChatGPT登录或API密钥的工具,而Runme相当于把Codex接入的浏览器端工作空间开源了出来。现在能尝试的,不只是搭建模型评估流水线,还包括把反复出现的部署检查、基础设施配置过程留存为笔记本,让团队成员直接在Google Drive里查阅参考。
| 分类 | 传统方式 | Codex + Runme |
|---|---|---|
| 文档化 | 散落在终端记录、Slack里 | 目标、过程、结果统一收纳进一份笔记本 |
| 复用 | 每次都要重写自动化脚本 | 可通过*.index.md检索以往的笔记本 |
| 共享 | 困在个人聊天记录里 | 通过Google Drive与团队成员共享 |
编辑视角
这篇文章有意思的地方在于,它不是OpenAI炫耀Codex的场合,而是用内部实例展示了Codex实际是怎么被用起来的。如果说8月23日我们报道过的Codex CLI是一个代替人在终端执行命令的代理,那么这次的Runme就是承载整个执行过程、把它变成文档的容器。工具本身并没有变多,变的是留存工具痕迹的方式。
把这种笔记本式的工作流搬到实际业务里,总会撞上同一个老问题——自动化脚本很快就能写出来,但为什么选这种方式,却几乎没人记下来。哪怕国内的开发团队用的不是Codex而是别的代理,把任务目标写进一个单元格、把结果和决策留在同一份文档里的这个习惯,本身是完全可以照搬过去的。尤其在新人入职培训、反复的部署检查这类人员流动频繁的工作场景里,效果会更明显。
WebMCP这个名字目前还挺陌生,但看OpenAI最近专门设奖金办了一场黑客松来推广它,不难看出它正相当认真地在推动直接在浏览器里开放工具这条路子。几周之内,类似Runme这样的客户端代理工具很可能还会再冒出几个,到那时,是否支持WebMCP,或许就会成为判断一个工具能不能在没有服务器基础设施的情况下接入代理的分水岭。




评论