新闻详情

新闻详情

首页 / 资讯中心 / 详情

15. M5 Max 128GB内存能支持的最大模型 ❀ 老梅子学AI

发布时间:2026/10/2 15:22:41来源:尧图网络
15. M5 Max 128GB内存能支持的最大模型 ❀ 老梅子学AI
【简介】各位都看到了Qwen-27B 8bit 大模型装完后内存只用了一半我想看看128GB内存都用满了能跑什么大模型。各位想看吗ChatGPT 的推荐当代人最幸福的事之一就是有了AI不知道的事问AI准没错。① 打开ChatGPU我问它我的设备适合那些本地大模型最好是能压榨性能的ChatGPT给出我五个答案。② 通常第一选项就是最优解还给出了针对128GB Mac优化的版本名称这不正好嘛。③ 打开LM Studio点击【模型搜索】图标复制粘贴优化版本名称竟然真的有刚刚推出才16天文件大小为107.33GB不知能不能跑下了再说。④ 千辛万苦总算把这一百多G下完了。⑤ 选择【开发者】菜单前面已经装载了Qwen3.8-27B点击【弹出】。为了更好的空出内存我们将Mac Studio重启。⑥ 重启之后可用内存有117.5GB相信装载107.33GB的本地大模型应该够了吧。⑦ 回到LM Studio【开发者】菜单点击【Load Model】。⑧ 选择Qwen3.8 Flash Nexe Server Mixed 4 8bit 大模型。⑨ 立即弹出加载模型失改的提示说我系统资源不足。⑩ 选择【My Models】菜单选择【LLMs】子菜单可以看到我们已经拥有两个大模型,奇怪的是最新的下载的模型这里没有参数量。有点不死心上下文选择最小的8K再次点击【Load Model】。⑪ 勾选允行强制加载点击【Load Anyway】强制加载。⑫ 好吧还是不行报一堆错误提示。⑬ 问问ChatGPT得到的答案是这个大模型太新了当前的LM Studio不支持。解决办法是用MLX Server。MLX Server 安装MLX-Serve只能跑在Apple M芯片MacWindows完全不能用专为统一内存优化。① MLX-Servegithub.com/ddalcu/mlx-serve是由ddalcu维护的一个本地LLM推理服务器用Zig编写面向Apple Silicon支持MLX和GGUF模型并提供OpenAI、Anthropic、Ollama兼容接口。② 这是功能说明。③ 可以通过Homebrew或Ollama安装。我们前面已经安装过Homebrew因此下面用Homebrew安装MLX-Serve。④ 在终端窗口复制粘贴第一行安装命令brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve回车。⑤ 执行完成后再复制粘贴第二行命令brew install --cask mlx-core这个是安装应用当然不用的也可以不安装。⑥ 提示报错说拒绝不受信任的mlx-core提示运行一个信任命令复制上面的提示命令并执行就可以了。⑦ 执行完成后再复制粘贴第三行命令brew install mlx-serve然后回车。⑧ 同样也是报不信任错误需要先执行信任命令再重新执行安装mlx-serve命令。注意前面安装mlx-core时只执行了信任命令没有再次执行安装mlx-core命令实际是没有安装mlx-core的后面再补安装命令。⑨ 安装完mlx-serve后执行命令mlx-serve --version可以查看当前版本号。⑩ 最后再补执行一下安装mlx-core命令。OK全部安装完成。MLX-Serve调用LM Studio下载的模型文件由于LM Studio已经下载了模型文件我们需要找到它再给MLX-Serve使用。① LM Studio 默认通常在 ~/.lmstudio/models/ 因此可以运行命令find ~/.lmstudio/models -type d -name *Qwen3.8-Flash-Next*来查找模型是否存在。② 果然看到模型文件以及存放路径。③ 然后我们再检查里面有没有最关键的文件ls -lh ~/.lmstudio/models/ddalcu/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit/ngram_table.bin。④ 文件大约 30GB。这个模型把巨大的 n-gram embedding 单独放在这里正是普通 MLX 模型和这个特殊 mlx-serve 包的主要区别之一。⑤ 执行模型启动命令mlx-serve \--model ~/.lmstudio/models/ddalcu/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit \--serve \--port 11234--model dir 直接指定一个现成的本地模型目录所以你不需要用 mlx-serve pull 重新下载。⑥ 模型加载完成。⑦ 奇怪的是并没有出现理所当然的把100G都装入内存的情况。那这个大模型能用吗⑧ 用浏览器打开地址127.0.0.0:11234出现了一个熟的界面这个是本地 OpenAI-compatible API。左下角显示已经装载一个大模型。⑨ 我让它介绍一下自己它告诉我说这是mlx-server的内置Web控制台。⑩ 我再问它运行的是什么模行告诉我的模型名字没有错但是大小是2MB是什么意思为什么这个模型文件这么大但实际运行内点内存却这么小有谁知道是什么原因吗⑪ 我们看看它自己的回答那花这么大精力运行的本地模型到底能做什么呢相信大家都想知道吧。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

hindsight:基于事件总线的可回溯日志分析,让事故复盘从小时级到分钟级 2026/10/2 16:05:41

hindsight:基于事件总线的可回溯日志分析,让事故复盘从小时级到分钟级

1. 事故复盘的第一性原理:后见之明本来就不是贬义词 如果你做过后端或者偏业务的技术系统,大概率经历过这种场景:半夜被报警电话拉起来,群里七嘴八舌,A说是缓存的问题,B说是数据库连接打满了,C直…

阅读更多 →
OpenCode终端AI编程助手使用指南:安装、配置与实战 2026/10/2 16:05:28

OpenCode终端AI编程助手使用指南:安装、配置与实战

如果你平时习惯在终端里干活,最近多半刷到过OpenCode这个名字。它本质上是一个开源的终端AI编程助手,你可以把它理解为跑在命令行里的AI结对程序员:不靠网页IDE,不靠图形界面,直接在终端里跟它对话,让它帮你…

阅读更多 →
Univer 在线表格单元格锁定:实现指定区域可编辑的完整指南 2026/10/2 16:05:22

Univer 在线表格单元格锁定:实现指定区域可编辑的完整指南

“想用在线表格做一个报名表或者工单登记表,业务同学打开网页就能填,但只能改我指定的那几格,标题、说明,还有那些公式列,一概不能碰”——这是我最近被问到次数最多的一个需求。字面听上去不复杂,真正落到…

阅读更多 →
AI进课堂不止讲题:备课、互动、作业、学情全场景提效指南 2026/10/2 16:05:22

AI进课堂不止讲题:备课、互动、作业、学情全场景提效指南

晚上十点,办公室灯还亮着。一位老师刚改完40份作业,接着要备明天的课——找一道能让学生眼睛发亮的例题,翻素材库翻了半天也没找到满意的。“AI进课堂”这个话题聊到现在,大家条件反射想到的都是“让AI给孩子讲题”,仿…

阅读更多 →
从EMD到CEEMDAN:模态分解演进与Python实现详解 2026/10/2 16:05:22

从EMD到CEEMDAN:模态分解演进与Python实现详解

简介:一套面向信号处理研究者的CEEMDAN改进算法MATLAB实现资源包,聚焦EMD、EEMD与CEEMDAN在非线性非平稳信号分析中的模态混叠问题。CEEMDAN利用自适应噪声取代EEMD的随机噪声,既能继承集成平均的稳健性,又能提高IMF分解精度与收敛…

阅读更多 →
Linux top命令实战:进程内存占用查看与系统排查技巧 2026/10/2 16:05:22

Linux top命令实战:进程内存占用查看与系统排查技巧

排查Linux服务器问题的时候,我干的第一件事永远是敲下 top 。这三个字母看起来简单,但它能告诉你的东西,几乎等于半台服务器的体检报告——哪个进程在抢CPU,谁把系统内存吃掉了,磁盘IO忙不忙,load averag…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉