新闻详情

新闻详情

首页 / 资讯中心 / 详情

拆解 LLM Checker 架构:确定性选型管线的 6 大执行阶段与组件职责

发布时间:2026/9/30 10:04:17来源:尧图网络
拆解 LLM Checker 架构:确定性选型管线的 6 大执行阶段与组件职责
拆解 LLM Checker 架构确定性选型管线的 6 大执行阶段与组件职责【免费下载链接】llm-checkerAdvanced CLI tool that scans your hardware and tells you exactly which LLM or sLLM models you can run locally, with full Ollama integration.项目地址: https://gitcode.com/gh_mirrors/ll/llm-checkerLLM Checker 是一款先进的硬件扫描 CLI 工具它能检测你的 CPU、GPU、内存与加速能力准确告诉你本机到底能跑哪些 LLM / sLLM 模型并与 Ollama 深度集成。本文带你拆解它背后的确定性模型选型管线——一条由 6 个执行阶段组成、每一步都有明确组件职责的推荐引擎让你彻底理解为什么它推荐的模型在你的机器上一定跑得动。一、先认识这条管线为什么叫确定性选型打开管线的主文件 deterministic-selector.js 可以看到一句注释Spec v1.0 的两阶段选择器。它的设计哲学是零幻觉推荐所有数字都可推导内存需求由参数量、量化等级、上下文长度按固定公式算出速度由后端常数 K 除以有效参数量估算所有假设都可审计MoE 稀疏推断、量化惩罚、基准分回退策略都写入结果的rationale推荐理由字段同一输入永远得到同一输出没有随机性推荐结果可复现。整条管线从selectModels()入口启动src/models/deterministic-selector.js依次经过以下 6 个执行阶段阶段名称一句话职责0数据采集扫描硬件 加载模型池1过滤安全过滤 任务类别筛选2估算量化选择 内存/速度估算3打分Q/S/F/C 多目标加权评分4排序Top N 排名 中档模型覆盖保障5验证可选快速探针实测 输出结果二、6 大执行阶段逐一拆解阶段 0数据采集——硬件画像与模型池代码中的PHASE 0: DATA SOURCESdeterministic-selector.js#L150负责回答两个问题机器有多强模型有哪些硬件画像getHardware()聚合 CPU 核数、GPU 型号与显存、总内存、加速支持Metal / CUDA / ROCm并由 normalizeHardwareProfile() 统一格式。关键计算是可用内存取min(0.8 × 总内存, 总内存 - 2GB)为操作系统留足余量本地盘点通过ollama list与ollama show解析已安装模型getInstalledModels()Ollama 未运行时静默降级为空列表模型池加载优先读取 Ollama 爬取缓存失效则回退到静态精选目录 catalog.jsonloadModelPool()并自动标记缓存是否过期超过 14 天视为 stale。阶段 1过滤——安全与任务类别双重筛选拿到合并去重后的模型池后管线先做减法安全过滤model-safety.js 移除未通过安全校验的模型uncensored 模型默认排除可用includeUncensored打开类别筛选filterByCategory() 按任务类别匹配——coding只留带 coder/code/instruct 标签的模型multimodal只留支持视觉的模型embeddings只留嵌入模型reasoning偏好 7B 以上大模型。这一步保证后续算力全部花在真正对口的模型上。阶段 2估算——量化选择与内存可行性PHASE 1: ESTIMATION FILTERdeterministic-selector.js#L1422是管线的硬约束关卡核心是 selectBestQuantization() 与 estimateMemoryBreakdown()量化阶梯下探按 Q8_0 → Q6_K → Q5_K_M → Q4_K_M → Q3_K → Q2_K 的顺序选择质量最高且装得下的量化等级目标上下文装不下时自动将上下文减半重试一次内存三部分拆解权重内存按每参数字节数表估算MoE 模型按总参数量而非活跃参数量计防止 236B MoE 被误判为能装下 KV Cache 运行时开销一票否决所需内存超过预算的模型直接出局不进入评分环节。阶段 3打分——Q/S/F/C 多目标加权评分通过可行性关卡的模型进入 evaluateModel() 的评分核心计算四个 0–100 的子分数分量含义计算方式Q质量优先查 quality-evals.js 中的实测基准分HumanEval、LiveBench 等按百分位映射无实测时回退为参数量基础分 家族加成 量化惩罚 新鲜度修正S速度后端常数 KMetal 160 / CUDA 220 / CPU-x86 70 / CPU-ARM 90÷ 有效参数量再乘量化与加速器倍数F契合度占用 ≤90% 预算得 100 分≤100% 得 70 分C上下文支持目标上下文得 100 分一半以上得 70 分不足则降权但不淘汰四个分量的权重来自集中式配置 scoring-config.js 的DETERMINISTIC_WEIGHTS——例如general为[0.45, 0.35, 0.15, 0.05]coding提升质量权重至 0.55。用户指定的优化目标speed / quality / context / coding还会与类别权重按优先级混合getScoringWeights()。此外还有一个隐藏分量H高容量修正显存充裕的机器会额外奖励 30B–70B 的甜点尺寸模型。阶段 4排序——Top N 排名与覆盖保障加权求和、截断到 0–100 后按分数降序取 Top N默认 5 个随后执行 ensureFeasibleMidTierCoverage()——这是体现产品思维的细节若榜单里全是小模型会强制提拔一个 7B 的中档模型前提是速度达标避免用户错过性价比甜点多 GPU 且显存 ≥30B 档位的机器还会保障榜单中至少出现一个 30B 大模型。同时 buildRationale() 为每个候选生成人类可读的理由如fits in 12.3/32GB, Q4_K_M, Metal backend, 14B is sweet spot。阶段 5验证——可选快速探针与结果输出PHASE 2: QUICK PROBEdeterministic-selector.js#L2380是可选的用实测校准估算环节对 Top N 候选逐个发起128 token 的真实生成测得实际 t/s实测速度写回候选并重算分数、重新排序结果按硬件指纹 模型 量化为键缓存到~/.llm-checker/bench.json7 天内直接复用最终由 formatRecommendations() 渲染成终端表格模型 / 参数量 / 量化 / 预估速度 / 内存 / 得分 / 理由并给出BEST PICK与一键ollama pull命令。三、组件职责速查表模块路径职责确定性选择器管线主体src/models/deterministic-selector.js6 阶段编排、估算、评分、探针权重配置src/models/scoring-config.js三套评分系统的集中权重定义安全过滤src/models/model-safety.js模型安全校验与 uncensored 识别MoE 假设src/models/moe-assumptions.jsMoE 参数画像、速度乘数、运行时归一化实测基准库src/data/quality-evals.jsOpen LLM / LiveBench 等实测分查询硬件检测src/hardware/detector.js 与 src/hardware/CPU/CUDA/ROCm/Apple Silicon 检测Ollama 客户端src/ollama/client.js已装模型盘点与探针生成静态模型目录src/models/catalog.json无缓存时的精选模型回退池四、如何使用这条管线安装后直接运行更多用法见 USAGE_GUIDE.md 与 docs/guides/advanced-usage.md快速体检llm-checker check——扫描硬件并检查 Ollama 集成状态按类别推荐llm-checker recommend --category coding——走完上述 6 个阶段输出带分数的 Top N 榜单与安装命令。五、小结LLM Checker 的确定性选型管线把我的电脑能跑什么模型这道开放题拆解成了采集 → 过滤 → 估算 → 打分 → 排序 → 验证六个职责清晰的阶段硬约束内存先行一票否决多目标加权Q/S/F/C/H负责择优覆盖保障避免榜单失衡可选探针用实测兜底估算。每个假设都写进rationale供你审计——这正是确定性三字的分量所在。想深挖更多架构细节可阅读 docs/reference/technical-docs.md。【免费下载链接】llm-checkerAdvanced CLI tool that scans your hardware and tells you exactly which LLM or sLLM models you can run locally, with full Ollama integration.项目地址: https://gitcode.com/gh_mirrors/ll/llm-checker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

数据库增删改查实战:从索引优化到事务与安全删除 2026/9/30 12:01:44

数据库增删改查实战:从索引优化到事务与安全删除

1. 增删改查的本质与整体设计思路聊数据库,绕不开的永远是这四个字:增删改查。说句实在话,我入行这些年,经手的业务系统少说也有几十个,从早期的单机管理软件,到后来基于微服务架构的中台系统,无…

阅读更多 →
小区域长时序InSAR高效处理:从数据裁剪到形变提取的实用流程 2026/9/30 12:01:44

小区域长时序InSAR高效处理:从数据裁剪到形变提取的实用流程

做Sentinel-1长时序InSAR这件事,有个很现实的门槛:不是原理看不懂,而是数据量实在压人。全画幅的Sentinel-1 SLC单景数据动辄几百MB到几个GB,30景数据跑一遍干涉基线网络,SNAP内存占用直接飙升到十几GB,处理…

阅读更多 →
Wireshark分析RTP丢包率:从抓包到统计的完整排查指南 2026/9/30 12:01:44

Wireshark分析RTP丢包率:从抓包到统计的完整排查指南

简介:这是一份以Wireshark分析RTP丢包率为主题的技术教程PDF,面向需要排查实时音视频网络质量的运维人员、测试工程师及网络协议学习者。内容围绕RTP传输中的丢包定位展开,从抓包过滤到流分析给出了清晰的操作路径,适合具备一定Wi…

阅读更多 →
Docker部署MySQL 8.0实战:数据持久化与连接坑全解 2026/9/30 12:01:36

Docker部署MySQL 8.0实战:数据持久化与连接坑全解

最近在整理韦奇这套部署环境时,碰上了一个特别典型的任务:用Docker把MySQL 8.0拉起来,数据还得持久化,开发、测试、预发三套环境都要用同一套部署方式,不能各自为政。折腾了一轮之后,我把整个落地过程完整梳…

阅读更多 →
Hadoop+Spark+Kafka+Hive民宿推荐系统全链路开发实战 2026/9/30 12:01:36

Hadoop+Spark+Kafka+Hive民宿推荐系统全链路开发实战

1. 这个毕设到底要做什么:民宿推荐系统的完整拼图如果你正在为一台 8G 内存的笔记本该选什么毕设题目发愁,同时又不想做烂大街的 XX 管理系统,我强烈建议你看看这个组合——Hadoop Spark Kafka Hive,配上民宿爬虫与可视化。我当…

阅读更多 →
Windows下用Nginx部署Vue3项目实战指南 2026/9/30 12:01:36

Windows下用Nginx部署Vue3项目实战指南

1. 为什么在Windows上用Nginx部署Vue3项目,是很多前端工程师绕不开的实战门槛? 你是不是也经历过:本地 npm run serve 跑得好好的,页面清爽、路由丝滑、状态管理稳如老狗;可一到打包部署环节,就卡在“访…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉