GenAI 搭配LLiMa
LLiMa 是 GenAI 工具組,用於在 Model Compiler 中編譯、測試、進行基準測試、部署和執行 LLM、VLM 和 ASR 模型,並在 Modalix 上運行。
LLiMa 支援三種輸入格式:
- Hugging Face safetensors — 標準的 LLM 和 VLM 模型目錄
- GGUF 檔案 — 以 GGUF 格式封裝的 LLM 模型。
- 壓縮張量模型——預先量化過的 GPTQ/AWQ 樣式的 safetensor 模型。
SiMa.ai 同時也會發布預先編譯的 GenAI 模型位於 Hugging Face。當已存在合適的模型時,從這裡開始。
對於具體情況 GenAI 範例,請參閱 範例.
LLiMa 可用性
LLiMa 編譯工具預設會安裝在 Model Compiler 中。 LLiMa 執行階段會原生安裝在 Modalix 上,作為 Neat 執行階段的一部分。 請參閱 Neat Framework 安裝,以了解執行階段的安裝流程。
貢獻
修改 LLiMa 本身的貢獻者應遵循 《LLiMa 貢獻者指南》,其中涵蓋了程式碼庫結構、開發環境、測試層級、模型輸入政策以及提交請求的要求。
支援的模型
下表顯示支援的模型架構及其功能:
| 模型架構 | 類型 | 支援的尺寸 |
|---|---|---|
| Llama 2 | LLM | 7b |
| Llama 3.1 | LLM | 8b |
| Llama 3.2 | LLM | 1b, 3b |
| Gemma 1 | LLM | 2b、7b |
| Gemma 2 | LLM | 2b、9b |
| Gemma 3 | LLM | 1b, 4b |
| Phi 3.5 mini | LLM | 3.8b |
| Phi 4 mini | LLM | 3.8b |
| Qwen 2.5 | LLM | 0.5b、1.5b、3b、7b |
| Qwen 3 | LLM | 0.6b、1.7b、4b、8b |
| Mistral 1 | LLM | 7b |
| LFM 2 | LLM | 350m、1.2b、2.6b。 |
| Llava 1.5 | VLM | 7b |
| PaliGemma | VLM | 3b |
| Gemma 3 | VLM | 4b |
| Gemma 4 | VLM | E2B, E4B |
| Qwen 2.5 VL | VLM | 3b, 7b |
| Qwen 3 VL | VLM | 2b, 4b, 8b |
| LFM 2 | VLM | 450m,1.6b,3b。 |
| Whisper | ASR | small |
限制事項
| 限制類型 | 描述 |
|---|---|
| 模型架構 | 僅支援基於上述架構的模型。 |
| 模型參數 | 僅支援參數數量少於 100 億的模型。 |
| HF 模型 | 模型必須以本機 Hugging Face 目錄的形式提供,該目錄應包含 config.json、safetensor 權重,以及架構所需的權杖化器和處理器檔案。generation_config.json 則是可選的。 |
| GGUF 模型 | GGUF 格式僅適用於 LLM。VLM 必須從 Hugging Face 的 safetensors 格式進行編譯。請注意,與 Hugging Face safetensor 編譯相比,效能可能會降低。 |
| 壓縮張量模型 | 支援的 LLM 和 VLM 可以使用預先量化的 safetensor 模型(GPTQ/AWQ),這些模型是使用 llm-compressor 建立的。模型必須使用對稱量化,並且使用支援的 compressed-tensors 佈局。這些模型可以在維持高效能的同時,達到比標準 INT4 量化更好的準確度。 |
| Gemma3 VLM | 支援經過修改的 SigLip 448 視覺編碼器。 |
| LLAMA 3.2 視覺模型 | 視覺模型目前不支援。 |