本地模型筛选标准
September 10, 2026 · View on GitHub
适用于内置本地模型目录、推荐顺序、内存门槛与推荐文案。2026-09-05 确认: 只在能力、速度、实际运行内存三个维度之间选取有明确优势的模型。
长期筛选规则
- 按可用内存划档,不按品牌凑名单。 参数量用于描述架构,不能替代内存; MoE 激活参数少也不代表全部权重占用小。新发布、知名品牌、视觉或编程标签本身 都不构成增加推荐位的理由。
- 只保留有优势的取舍。 同一内存档最多保留一个能力选择和一个速度选择; 若同一个模型兼得,则只留一个。若另一个模型能力不差、速度不慢、内存不多, 且至少一项有可复现的实质优势,移除被全面超过的推荐。差异落在测量噪声内时 不宣布胜出,不通过任意加权分数制造冠军。
- 能力优先采用独立、公开方法的评测。 记录榜单版本、原始页面、评测日期、 推理档位及测试设置。厂商自报或榜单 estimated 值单独标明,仅用于候选筛选; 不与实测值混为同等证据。不混用不同版本的综合指数,不平均无关榜单分数。
- 比较单位是具体配置。 模型版本、权重/量化、思考设置、上下文、推理引擎和 版本缺一不可。原模型/API 的成绩不能直接贴到本地 4-bit 包装上;高思考档的 能力分数不能与关闭思考的速度拼成一条“实测最佳”。
- 速度必须来自对应硬件实测。 同机器、同运行时、同输入/输出长度与思考预算, 报告首字延迟、预填充速度、输出速度及完成整个请求的时间;区分冷启动和热运行, 重复测量并报告中位数、波动和 swap 情况。API tokens/s 不代表 Mac tokens/s。
- 内存使用运行峰值。 区分下载大小、加载峰值、稳定运行峰值;记录上下文长度、 KV cache 精度、并发数及测量口径。仅进程 RSS 或 MLX allocator 数值不能冒充 系统总占用。门槛须为操作系统和 Cindy 留空间;不能把“偶尔装得下”写成“适合”。
- 证据不足允许空位。 候选可以在小规模候选目录中供手动选择,但不自动进入 推荐区,不因 RAM 足够、没有其他推荐或内存未知而晋升。正式增加推荐前应补齐 对应配置的能力依据和本机速度/内存比较。当前保留推荐的证据缺口也要公开记录。
- 每次更新同时写入取舍记录。 新模型应替换它胜出的旧位置,而非不断追加。 研究中的候选只保留有希望填补空位或替换现有模型的少数项;确认无优势后退出目录。
目录与证据入口
当前候选、推荐和门槛读取活动 Registry;不要根据文档中的旧型号表重建名单。 2026-09-05 的型号取舍、量化标签、性能来源和未验证项保留在 历史证据快照,它不是今天的推荐清单。 架构、代码导航和完整发布步骤见 模型配置与下发。
实现边界与以后更新
- 数据正本:Server 的
model-access-server/catalog/providers.json中modelRegistry.localModels;客户端离线副本位于packages/model-providers/catalog/model-registry.json的localModels。 算法入口仍为apps/desktop/src/shared/localModelRuntime.ts。featuredIds按能力、速度顺序列推荐;models中的候选不会自动补位。 - 包装的平台限制和内存门槛从活动目录读取;低于推荐门槛或内存未知返回空推荐。 不在本规则另存一份型号白名单或硬件阈值。
- 新用户看到更新后的目录;未修改默认值的老用户也看到新目录,但不自动安装或切换模型。 已手动配置的用户保留选择;目录淘汰不卸载模型、不删除供应商、不改变任务使用的模型。 用户仍可通过手动标签拉取目录外模型。
- 修改条目时附上:日期、精确模型/量化/思考设置、榜单及版本、是否 estimated、 硬件和引擎版本、上下文和缓存设置、速度/延迟/完整耗时、加载与运行峰值、原始日志链接、 被替换条目和三维取舍理由。缺项写“未验证”,不能补猜测数字。
- 配套验证须覆盖:低内存/未知内存空推荐、推荐名单不得被目录兜底绕过、平台包装过滤、 推荐变化不影响手动拉取或已安装模型。文案避免“最强”“最适合你”等超出证据的结论。
服务端下发与发布
以下是双方需满足的协议合同,是否已部署按 发布验收 核对。
- 复用现有匿名目录接口,客户端请求
registrySchemaVersion=4,本地域为modelRegistry.localModels = { version: 1, models, featuredIds }。共享 Registry 的updatedAt、校验、缓存与刷新事件,不另建请求或持久化层。 - 服务端下发名称、搜索别名、具体包装、内存提示、五语简介、证据链接及推荐顺序。
客户端继续负责平台/内存适配、用户选择、下载与执行。未知内存不自动推荐。
普通包装可通过目录新增;新推理协议仍需客户端实现。
qwen-xhigh只允许当前已支持 的三个 Qwen3.8 27B 标签,远程数据不能提供命令、路径或任意下载 URL。 - 明确的空
models/featuredIds分别撤下目录 / 推荐;字段缺失表示旧服务端, 使用随包本地域。网络失败、非法数据和 revision 冲突沿用已有合法快照。 - 发布顺序为服务端先行、客户端随后。旧客户端默认收到 Registry V2;显式请求 V1/V2/V3 时剥离新字段。各响应版本有独立内容 ETag,不能跨版本误命中 304。
- 每次先在 Server 正本更新取舍记录和本地域,增加整个 Registry 的
updatedAt, 再把完整 Registry(含baseModels与modelRef)同步到客户端离线副本,核对同 revision、同内容。 同步不改写用户显式档位或供应商实报默认档;历次同步状态见历史记录,不能当作生产发布证据。 后续服务端 revision 必须高于已发布版本,禁止只复制本地域或使用相同 revision 发布不同内容。 - 本地与云端接入可用
modelRef引用同一公共型号;量化包装、内存与推荐证据独立留在本地域。 用户文件可覆盖推荐及单项资料,优先级见 模型资料优先级。 - 若生产配置了
MODEL_CATALOG_URL,还须同步该覆盖源;只修改制品内置目录不能证明 线上生效。部署后核对 V4 响应、旧版响应与新客户端刷新;离线首次启动核对随包兜底。 - 目录撤下或调整顺序不卸载、切换用户模型,也不修改已有供应商和执行中的配置。