jundot/omlx
用菜单栏就能开关的Mac本地大模型服务器
oMLX是一个开源项目,让你在搭载Apple Silicon芯片的Mac上直接运行大语言模型,并通过原生菜单栏应用来管理服务器。它支持同时处理多个请求的连续批处理,以及把可复用的计算结果分别存在内存和SSD两级缓存中。它兼容OpenAI和Anthropic的接口格式,现有工具无需改动即可接入。
它做什么
- 一个服务器同时支持文本模型、能理解图像的视觉语言模型、OCR模型、向量嵌入模型和重排序模型。
- 把之前算过的对话上下文分别保存在速度快的内存层和容量大的SSD层,即使对话中途上下文发生变化也能复用,服务器重启后也能从硬盘恢复而无需重新计算。
- 提供实验性的多台Mac分布式推理功能,可以把一个大模型拆分到内存大小不同的多台Mac上运行。
- 开启专用加速内核后,GLM-5.2、MiniMax M3等模型在M3 Ultra上处理速度约为每秒845个词元,比未开启时约29个词元快约30倍。
- 管理后台可以一键下载模型、聊天测试、跑性能测试、调整每个模型的详细设置,不需要手动改配置文件。
为什么重要
这让想在Mac上本地跑大模型的开发者和研究者,不用敲命令行也能轻松管理内存和性能。对于和编程助手工具配合使用的场景尤其重要,因为复用缓存的上下文而不是重新计算,能实实在在地节省时间和成本。
本仓库术语
- 连续批处理 · 把多个用户的请求一起处理而不是逐个排队处理,从而提高效率
- KV缓存 · 保存模型之前计算过的结果,避免重复计算的临时存储空间
- Apple Silicon · 苹果自研的Mac芯片,如M1、M2、M3、M4
- MCP(模型上下文协议) · 让AI模型能够连接外部工具或数据的一种标准通信方式
- LRU淘汰 · 自动把最久未被使用的内容从内存中移除的机制
仓库简介(英文)
managed from the macOS menu bar
在 GitHub 打开热门仓库
- cathrynlavery/diagram-design让AI编程工具画出杂志排版质感图表,而不是千篇一律的圆角方框
- public-apis/public-apis一份由社区维护的免费API大全仓库
- semantica-agi/semantica一个让AI智能体的决策可追溯、可审计的开源图谱基础设施
- cactus-compute/needle一个14MB的AI模型,让手机和可穿戴设备无需联网就能调用工具
- unslothai/unsloth一款让你在自己电脑上运行和训练AI模型的桌面应用,无需写代码
- macro-inc/macro把邮件、聊天、文档、任务和CRM互相链接、共享同一份AI团队记忆的一体化办公平台
- harry0703/MoneyPrinterTurbo只需一个主题或关键词,就能自动生成配好文案、素材、字幕和音乐的完整短视频的开源工具
- basecamp/omarchyDHH打造的、开箱即用且风格统一的Linux发行版