跳到內容

本地模型市集

依用途挑選、看得懂跑不跑得動、一鍵安裝。


跑本地模型的門檻從來不是硬體,是術語。GGUF、Q4_K_M、imatrix、context window、MoE,這些字擋在「我想要一個離線能用的 AI」和「真的裝起來」之間。本地模型市集把這條路收斂成三個看得懂的步驟。


在「管理 → 本地模型」選一個用途,系統掃 Hugging Face 上五家品質驗證過的發布者,每個推薦附一顆依你這台機器算出來的適配燈(綠/黃/紅),按下安裝就自動挑量化版本、續傳下載、裝完即用。

選一個用途
|
v
+----------------------+
| 掃描 Hugging Face | <-- 五家品質驗證發布者,
| | 結果快取 24 小時
+----------+-----------+
|
v
+----------------------+
| 計算適配燈 | <-- 對照這台機器
| (🟢/🟡/🔴) | 現在的記憶體
+----------+-----------+
|
v
+----------------------+
| 一鍵安裝 | <-- 裝得下的最高品質量化版,
| | 斷線續傳
+----------------------+

聊天助理/寫程式/長文件/中文優先。不用知道模型名。

燈號 含義
🟢 可舒適執行 記憶體佔用低於六成,日常使用不影響其他工作
🟡 勉強可跑 裝得下但吃緊,建議關閉其他大型程式
🔴 裝不下 這個版本超過這台機器的能力

判定式用的是實際檔案大小+推理時的快取預留+執行環境開銷,對照目前可用記憶體的九成:不是理論值,是這台機器現在的狀況。

自動挑「裝得下的最高品質」量化版本(優先 imatrix 校準版),斷線續傳,裝完自動出現在已安裝清單。


MoE 模型的雙軌判定:讓 16GB 機器跑 30B

Section titled “MoE 模型的雙軌判定:讓 16GB 機器跑 30B”

MoE(Mixture-of-Experts)模型像 30B-A3B:總參數 30B,但每個字實際只動用 3B。這類模型的 expert 權重不需要全部塞進快速記憶體,turbo-fieldfare 專案實證了 26B 模型常駐 2GB 也能跑。市集對 MoE 模型因此顯示兩顆燈:

軌道 判定內容
全載入 整包塞進記憶體的傳統判定
省顯存模式 只有共享層進 GPU、expert 留在系統記憶體的判定

全載入紅燈但省顯存綠燈的模型會標「省顯存模式可用」。執行層今天就能啟用:inference.toml[llamafile] extra_args = ["--cpu-moe"](llamafile 底層就是 llama.cpp)。llama.cpp 原生的 expert SSD streaming(上游 PR #25294)合併後會再跟進成一格開關。


  • 進階抽屜:每個模型的全部量化版本手選,含 imatrix 標示、每檔各自的適配燈與省顯存判定。
  • 手動安裝:直接輸入任何 Hugging Face repo(org/Model-GGUF),一樣枚舉 quant+算適配,這是舊「清單機制」的替代逃生口。
  • LoRA 與其他調整:經 inference.toml[llamafile] extra_args 傳遞(如 ["--lora", "/path/adapter.gguf"]),推理設定頁可編輯。
  • HF token:環境變數 HF_TOKEN:限額翻倍+可存取需授權(gated)模型。

五家發布者白名單:unsloth(MoE 強項)、bartowski、mradermacher、lmstudio-community、ggml-org,依社群量化品質基準(KL divergence 對照原始權重)挑選;同一模型多家發布時自動去重取最優。搜尋結果快取 24 小時;Hugging Face 不可達時退回快取,絕不擋頁面。


  • 模型檔就是註冊表:安裝=檔案落到 ~/.duduclaw/models/,刪除=刪檔。AI 員工面的 model_listmodel_load MCP 工具讀同一個目錄,行為不變。
  • 推理設定頁維持原樣:後端選擇、路由、llamafile 參數都留在原處,搬走的只有「找模型、裝模型」這段。

市集用看得懂的話回答三個問題:這個模型是做什麼用的、這台機器跑不跑得動、怎麼裝:一個用途選擇器、一顆用真實記憶體數字算出來的適配燈、一次可續傳的一鍵安裝。