新闻详情

新闻详情

首页 / 资讯中心 / 详情

exo:多台设备组AI集群,RDMA让大模型跑得更快

发布时间:2026/8/31 10:49:02来源:尧图网络
exo:多台设备组AI集群,RDMA让大模型跑得更快
exo多台设备组AI集群RDMA让大模型跑得更快【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 是一个开源的本地 AI 集群工具把它装上 MacBook、Mac Studio 甚至 Linux 服务器设备之间自动发现、自动切分模型让单机装不下的超大模型在你的桌面上跑起来。 项目亮点速览4 台 512GB M3 Ultra Mac Studio 同时加载 DeepSeek v3.18-bit与 Kimi K2 Thinking4-bit自动发现零配置组网所有装了 exo 的设备开机即互相发现不用手动填 IP 或开端口加机器就变快支持张量并行2 台设备最高1.8 倍加速4 台最高3.2 倍README 特性数据RDMA over Thunderbolt 5设备间延迟降低99%这是加设备反而更快的关键这些能力背后是几条清晰的代码主线拆开看并不复杂。 架构与核心模块master 协调节点感知设备拓扑、决定模型怎么切分、对外提供 API代码在 src/exo/master/worker 推理节点执行真正的推理苹果设备上由 MLX 引擎 承担支持自动并行切分routing 消息层节点间基于 pub/sub 的事件路由模型下载、推理状态实时同步见 src/exo/routing/内置 Web 仪表盘每台设备都自带管理集群、聊天、看拓扑源码在 dashboard/ 性能实测4 节点集群的数据Qwen3 235B A22B8-bit解码速度对比数据来自仓库内基准测试图测试条件4 台 M3 Ultra Mac Studio 通过 Thunderbolt 5 全互联张量并行4 节点 RDMA解码31.9 t/s同配置走 TCPllama.cpp只有 15.2 t/sexo 约为其 2 倍单节点基线exo RDMA 19.5 t/sllama.cpp TCP 20.4 t/s两者基本打平——节点越多RDMA 优势越大单节点跑平、多节点拉开差距说明这套架构的瓶颈确实压在设备间通信上。快速上手三步跑起你的第一个节点从一台 MacBook 开始即可不必先凑齐集群git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build uv run exo装好uv、node、rust后按上面三行操作浏览器打开http://localhost:52415就能聊天、看集群状态。macOS 用户更省事brew install --cask exo安装菜单栏应用需 macOS 26.2它会在后台常驻并自动处理网络配置。进阶玩法与调优技巧开 RDMAmacOS 26.2 进恢复模式执行rdma_ctl enable设备间用 TB5 线全互联Mac Studio 避开网口旁的 TB5 口这是提速的前提纯协调节点uv run exo --no-worker让配置弱的机器只负责组网和调度不跑推理模型放外置盘设置EXO_MODELS_DIRS/Volumes/ExternalSSD把模型缓存指到大容量 SSD隔离集群设置EXO_LIBP2P_NAMESPACEdev同一网络下多套集群互不串台量化对比分片方案用 bench/exo_bench.py 跑不同 placement 的 prefill/decode 速度挑最优方案适用场景与生态集成单机装不下的大模型671B 级别的 MoE 模型切到 4 台机器上推理本地跑通现有工具直接接入提供 OpenAI Chat Completions、Claude Messages、Ollama 等兼容 APIOpenWebUI 这类前端可以直接指向它接口细节见 docs/api.md评测与调优仓库自带 bench/ 基准与评测脚本换模型、换分片方式都能量化对比写在最后exo 把分布式推理从论文拉回了日常先在一台机器上把uv run exo跑通等第二台设备开机时你会直观看到它被自动发现、模型被重新切分。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

MLX上DFlash+4bit量化模型实战:mlx-community模型加速配置详解 2026/8/31 12:49:33

MLX上DFlash+4bit量化模型实战:mlx-community模型加速配置详解

MLX上DFlash4bit量化模型实战:mlx-community模型加速配置详解 【免费下载链接】dflash DFlash: Block Diffusion for Flash Speculative Decoding 项目地址: https://gitcode.com/GitHub_Trending/df/dflash 想在 Mac 上本地跑大模型,DFlash 是一…

阅读更多 →
T3 Code认证体系全解:环境认证、按方法授权与Scope映射如何协同 2026/8/31 12:49:33

T3 Code认证体系全解:环境认证、按方法授权与Scope映射如何协同

T3 Code认证体系全解:环境认证、按方法授权与Scope映射如何协同 【免费下载链接】t3code 项目地址: https://gitcode.com/GitHub_Trending/t3/t3code T3 Code 是一款面向 AI 编程代理的开源开发工具(支持 Web、桌面与移动端客户端)&a…

阅读更多 →
快人8倍:whisper.cpp CUDA加速实战与GPU性能压榨指南 2026/8/31 12:49:33

快人8倍:whisper.cpp CUDA加速实战与GPU性能压榨指南

快人8倍:whisper.cpp CUDA加速实战与GPU性能压榨指南 【免费下载链接】whisper.cpp Port of OpenAIs Whisper model in C/C 项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp whisper.cpp 是 OpenAI Whisper 的 C/C 移植,而它的 CU…

阅读更多 →
JeecgBoot 前端如何用 Nginx 部署:最小可用配置到性能调优完整指南 2026/8/31 12:49:33

JeecgBoot 前端如何用 Nginx 部署:最小可用配置到性能调优完整指南

JeecgBoot 前端如何用 Nginx 部署:最小可用配置到性能调优完整指南 【免费下载链接】jeecg-boot 【低代码v2.0,一句话即可生成整个系统】企业级AI低代码平台,一键生成前后端代码甚至整个系统。 AI Skills 一句话画流程、设计表单、生成报表、…

阅读更多 →
Claude Code Game Studios 49个Agent花名册全清单:从创意总监到社区经理 2026/8/31 12:49:33

Claude Code Game Studios 49个Agent花名册全清单:从创意总监到社区经理

Claude Code Game Studios 49个Agent花名册全清单:从创意总监到社区经理 【免费下载链接】Claude-Code-Game-Studios Turn Claude Code into a full game dev studio — 49 AI agents, 72 workflow skills, and a complete coordination system mirroring real stud…

阅读更多 →
从问答到自主执行:智能体工作台Qwen Work的落地实践与避坑指南 2026/8/31 12:44:32

从问答到自主执行:智能体工作台Qwen Work的落地实践与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞