跳至主要内容

GenAI搭配LLiMa

LLiMa 是 GenAI 工具組,用於在 Model Compiler 中編譯、測試、進行基準測試、部署和執行 LLM、VLM 和 ASR 模型,並在 Modalix 上運行。

LLiMa 支援三種輸入格式:

  • Hugging Face safetensors — 標準的 LLM 和 VLM 模型目錄
  • GGUF 檔案 — 以 GGUF 格式封裝的 LLM 模型。
  • 壓縮張量模型——預先量化過的 GPTQ/AWQ 樣式的 safetensor 模型。

SiMa.ai 同時也會發布預先編譯的 GenAI 模型位於 Hugging Face。當已存在合適的模型時,從這裡開始。

對於具體情況 GenAI 範例,請參閱 範例.

LLiMa 可用性

LLiMa 編譯工具預設會安裝在 Model Compiler 中。 LLiMa 執行階段會原生安裝在 Modalix 上,作為 Neat 執行階段的一部分。 請參閱 Neat Framework 安裝,以了解執行階段的安裝流程。

貢獻

修改 LLiMa 本身的貢獻者應遵循 《LLiMa 貢獻者指南》,其中涵蓋了程式碼庫結構、開發環境、測試層級、模型輸入政策以及提交請求的要求。

支援的模型

下表顯示支援的模型架構及其功能:

模型架構類型支援的尺寸
Llama 2LLM7b
Llama 3.1LLM8b
Llama 3.2LLM1b, 3b
Gemma 1LLM2b、7b
Gemma 2LLM2b、9b
Gemma 3LLM1b, 4b
Phi 3.5 mini LLM3.8b
Phi 4 mini LLM3.8b
Qwen 2.5LLM0.5b1.5b3b7b
Qwen 3LLM0.6b1.7b4b8b
Mistral 1LLM7b
LFM 2LLM350m1.2b2.6b
Llava 1.5VLM7b
PaliGemmaVLM3b
Gemma 3VLM4b
Gemma 4VLME2B, E4B
Qwen 2.5 VL VLM3b, 7b
Qwen 3 VL VLM2b, 4b, 8b
LFM 2VLM450m1.6b3b
WhisperASRsmall

限制事項

限制類型描述
模型架構僅支援基於上述架構的模型。
模型參數僅支援參數數量少於 100 億的模型。
HF 模型模型必須以本機 Hugging Face 目錄的形式提供,該目錄應包含 config.json、safetensor 權重,以及架構所需的權杖化器和處理器檔案。generation_config.json 則是可選的。
GGUF 模型GGUF 格式僅適用於 LLM。VLM 必須從 Hugging Face 的 safetensors 格式進行編譯。請注意,與 Hugging Face safetensor 編譯相比,效能可能會降低。
壓縮張量模型支援的 LLM 和 VLM 可以使用預先量化的 safetensor 模型(GPTQ/AWQ),這些模型是使用 llm-compressor 建立的。模型必須使用對稱量化,並且使用支援的 compressed-tensors 佈局。這些模型可以在維持高效能的同時,達到比標準 INT4 量化更好的準確度。
Gemma3 VLM支援經過修改的 SigLip 448 視覺編碼器。
LLAMA 3.2 視覺模型視覺模型目前不支援。