新闻详情

新闻详情

首页 / 资讯中心 / 详情

235B 模型塞不进一台 Mac:exo 分布式推理的多机切分方案

发布时间:2026/8/31 9:03:43来源:尧图网络
235B 模型塞不进一台 Mac:exo 分布式推理的多机切分方案
235B 模型塞不进一台 Macexo 分布式推理的多机切分方案【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 是一个本地 AI 集群项目在每台 Mac 上装好它设备会在局域网内自动发现彼此把单机装不下的模型切到所有节点上跑推理并对外提供 OpenAI、Claude、Ollama 兼容的 API。这篇文章讲清它的发现与切分机制以及怎么真正跑起来。为什么一台机器不够本地推理的瓶颈通常不是算力而是内存。Qwen3-235B 8-bit 权重大于 200GBDeepSeek v3.1 671B 更是超过 600GB一台 512GB 的 Mac Studio 也装不下MacBook Pro 就更别提了。常规替代方案是租云端 GPU 或者换小模型前者贵后者妥协。exo 的定位是把同一个模型切到多台 Apple Silicon 设备上每台机器负责一部分权重机器越多能跑的模型越大——官方集群用 4 台 Mac Studio 同时跑起了 DeepSeek v3.1 671B 和 Kimi K2 Thinking下面这张就是其中的基准测试画面。自动发现与模型切分是怎么运作的 ⚡同网段的节点启动后自动互相发现并选举出一个 master 节点由它维护一张拓扑图设备是节点连接是边边可以是局域网 socket 或 Thunderbolt 5 上的 RDMA远程直接内存访问绕过网络栈直接读写对端内存。加载模型时它先筛出总内存足够的节点环再按每台机器的可用内存占比分配层数——相当于把一条长流水线按每个人的工作量切段大内存机器分更多层。TB5 组网下还能切换张量并行一层被多台机器并行计算2 台设备约 1.8 倍加速不只是内存叠加。切分逻辑的核心在 src/exo/master/placement.py。3 条命令起一个集群前置依赖是 uv 和 node后者用来构建 dashboardgit clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build cd .. uv run exodashboard 和 API 会在http://localhost:52415/起来。在第二台 Mac 上跑同样的命令同局域网下自动加入集群不需要任何配置。macOS 26.2 也可以直接brew install --cask exo装菜单栏应用从源码跑则还要装 Rust nightly 和 macmon 的指定 forkREADME 里写了完整步骤。模型首次使用会下载到~/.exo/modelsmacOS或~/.local/share/exo/modelsLinux想放到外置盘或 NFS 上用环境变量EXO_MODELS_DIRS指定有空间的目录。dashboard 本身分聊天、下载、traces 几个页面节点变化时 master 会重新选举期间 API 会短暂无响应看到偶发超时先确认是不是有节点刚掉线。用着会踩的坑 ⚠️如果你发现节点没被识别先检查两台机器是否同一局域网、52413发现和 52414通信端口有没有被防火墙挡掉同一网络里跑多个 exo 集群时改启动参数--namespace隔离不同 namespace 的节点互不连接。RDMA over Thunderbolt 5 是可选特性需要 macOS 26.2进恢复模式执行rdma_ctl enable集群内所有节点要用 TB5 线缆两两直连全互联各设备系统版本必须完全一致beta 号都得相同Mac Studio 上不能用以太网口旁边那个 TB5 口。条件凑不齐就先用普通局域网跑得起来只是没有 99% 延迟降低。实例创建是异步的POST /instance之后服务端只回“命令已接收”要等/instance/await返回 ready 再发推理请求否则会拿到超时。排障时日志在~/.cache/exo/exo_log/先看那里再看网络。它适合谁 / 不适合谁有两台以上 Apple Silicon 设备、想把大参数开源模型跑在本地的人这个方案的价值很直接兼容 4 种 API 格式现有 OpenAI、Claude、Ollama 客户端把 base URL 指到localhost:52415就能用已有脚本不用改。只有一台机器的人分布式推理没有意义单机场景下它等价于一个本地推理框架想搭高并发线上服务也不合适它是少数并发流下的本地工具不是生产 serving 平台。Linux 端目前只跑 CPUGPU 支持还在开发集群全是 Linux 机器的话先降低预期。下一步可以翻 docs/api.md 的端点清单用/instance/previews在加载前预览一个模型会被切到哪几台机器再去仓库 issues 里看看社区正在调的切分参数真实硬件组合的答案大多在那里。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

逃离塔科夫升级Unity 6与DX12第四版:渲染架构与性能优化解析 2026/8/31 11:29:19

逃离塔科夫升级Unity 6与DX12第四版:渲染架构与性能优化解析

这次我们来看《逃离塔科夫》在 1.3.0.0 版本的一次大动作:升级 Unity 6 引擎 DirectX 12 第四版渲染器,目标时间节点标的是 26.8.11。先别急着把这个当成“又一顿画质饼”。从技术层面看,这可能是塔科夫这么多年以来最伤筋动骨的一次底层替换…

阅读更多 →
Coze与Dify:AI工作流平台的定位、部署与实战对比 2026/8/31 11:29:19

Coze与Dify:AI工作流平台的定位、部署与实战对比

Coze和Dify这两个词,最近在工作流和AI自动化领域出现的频率非常高。很多人一开始容易搞混:它们到底是不是同一个东西?学哪个才更值?我的结论是: Coze和Dify不是替代关系,而是两类定位不同的AI工作流工具 …

阅读更多 →
GPT-Image-2实战指南:从API接入到532个案例的完整拆解 2026/8/31 11:29:19

GPT-Image-2实战指南:从API接入到532个案例的完整拆解

GPT-Image-2 这个模型发布后,社区里的玩法更新速度比很多人的预期快得多。官方的示例 Demo 只能展示基础能力,真正能体现模型价值的是在真实业务场景里怎么落地的案例。最近正好看到有人整理了 532 个 GPT-Image-2 实战案例,项目在 GitHub 上…

阅读更多 →
DeepSeek Harness 实战:10轮提示驱动工业级LLM应用开发 2026/8/31 11:29:19

DeepSeek Harness 实战:10轮提示驱动工业级LLM应用开发

最近在技术社区里,DeepSeek Harness 的出现频率越来越高。围绕它的话题从“怎么安装”延伸到“卡在 pnpm dsh web”,再到“Skills 怎么让模型稳定输出”,基本覆盖了本地 LLM 工作流落地的各个环节。这次我们用一篇文章把 DeepSeek Harness 从…

阅读更多 →
蘑菇街测试实习生面试复盘:用例设计、SQL与自动化测试考点解析 2026/8/31 11:29:19

蘑菇街测试实习生面试复盘:用例设计、SQL与自动化测试考点解析

1. 从蘑菇街测试实习JD倒推:面试官到底在挑什么人 先说个现象:每年春招秋招,测试实习生的简历能堆满一个屏幕,但真正能走到面试环节的其实不多。有人以为测试岗门槛低,随便准备几道题就能过;也有人以为测试…

阅读更多 →
从零到一:开关电源模块设计实战指南(原理图、PCB、调试全流程) 2026/8/31 11:24:18

从零到一:开关电源模块设计实战指南(原理图、PCB、调试全流程)

在硬件开发、电子竞赛和毕业设计中,一个稳定可靠的电源模块往往是整个系统成功的基础。然而,很多同学和工程师在初次接触电源设计时,常常感到无从下手:原理图怎么画?PCB布局要注意什么?芯片怎么选&#xff…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞