每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

jundot/omlx

19,928今日 +472Python

用菜单栏就能开关的Mac本地大模型服务器

oMLX是一个开源项目,让你在搭载Apple Silicon芯片的Mac上直接运行大语言模型,并通过原生菜单栏应用来管理服务器。它支持同时处理多个请求的连续批处理,以及把可复用的计算结果分别存在内存和SSD两级缓存中。它兼容OpenAI和Anthropic的接口格式,现有工具无需改动即可接入。

它做什么

  1. 一个服务器同时支持文本模型、能理解图像的视觉语言模型、OCR模型、向量嵌入模型和重排序模型。
  2. 把之前算过的对话上下文分别保存在速度快的内存层和容量大的SSD层,即使对话中途上下文发生变化也能复用,服务器重启后也能从硬盘恢复而无需重新计算。
  3. 提供实验性的多台Mac分布式推理功能,可以把一个大模型拆分到内存大小不同的多台Mac上运行。
  4. 开启专用加速内核后,GLM-5.2、MiniMax M3等模型在M3 Ultra上处理速度约为每秒845个词元,比未开启时约29个词元快约30倍。
  5. 管理后台可以一键下载模型、聊天测试、跑性能测试、调整每个模型的详细设置,不需要手动改配置文件。

为什么重要

这让想在Mac上本地跑大模型的开发者和研究者,不用敲命令行也能轻松管理内存和性能。对于和编程助手工具配合使用的场景尤其重要,因为复用缓存的上下文而不是重新计算,能实实在在地节省时间和成本。

本仓库术语

  • 连续批处理 · 把多个用户的请求一起处理而不是逐个排队处理,从而提高效率
  • KV缓存 · 保存模型之前计算过的结果,避免重复计算的临时存储空间
  • Apple Silicon · 苹果自研的Mac芯片,如M1、M2、M3、M4
  • MCP(模型上下文协议) · 让AI模型能够连接外部工具或数据的一种标准通信方式
  • LRU淘汰 · 自动把最久未被使用的内容从内存中移除的机制

仓库简介(英文)

managed from the macOS menu bar

在 GitHub 打开

热门仓库

全部仓库 →

METAL LAB 最新报道