Перейти до основного вмісту

GenAI з використанням LLiMa

LLiMa — це набір інструментів GenAI у Model Compiler, призначений для компіляції, тестування, проведення тестів продуктивності й розгортання моделей LLM, VLM та ASR, а також для їх запуску на платформі Modalix.

LLiMa підтримує три формати вхідних даних:

  • Hugging Face safetensors — стандартні каталоги для моделей LLM та VLM.
  • Файли GGUF — моделі LLM, упаковані у формат GGUF.
  • Стиснені тензорні моделі — попередньо квантовані моделі у форматі safetensor, що використовують методи GPTQ/AWQ.

SiMa.ai також публікує попередньо скомпільовані GenAI моделі на Hugging Face . Почніть звідти, якщо вже існує відповідна модель.

Для перегляду конкретних демонстрацій GenAI, див. приклади .

LLiMa Наявність

Інструменти для компіляції LLiMa встановлюються за замовчуванням у Model Compiler. LLiMa runtime встановлюється нативно в Modalix як частина Neat runtime. Див. Neat Framework installation для отримання інформації про процес встановлення runtime.

Беручи участь / Вносячи свій внесок

Автори, які вносять зміни безпосередньо до LLiMa, повинні дотримуватися Посібника для авторів LLiMa щодо структури репозиторію, середовищ розробки, рівнів тестування, політики щодо вхідних даних для моделі та вимог до запитів на внесення змін.

Підтримувані моделі

Наступна таблиця містить інформацію про підтримувані архітектури моделей та їхні можливості:

Архітектура моделі.ТипПідтримувані розміри
Llama 2LLM7b
Llama 3.1LLM8b
Llama 3.2LLM1b, 3b
Gemma 1LLM2b, 7b
Gemma 2LLM2b, 9b
Gemma 3LLM1b, 4b
Phi 3.5 mini LLM3.8b
Phi 4 mini LLM3.8b
Qwen 2.5LLM0.5b, 1.5b, 3b, 7b
Qwen 3LLM0.6b, 1.7b, 4b, 8b
Mistral 1LLM7b
LFM 2LLM350m, 1.2b, 2.6b.
Llava 1.5VLM7b
PaliGemmaVLM3b
Gemma 3VLM4b
Gemma 4VLME2B, E4B
Qwen 2.5 VL VLM3b, 7b
Qwen 3 VL VLM2b, 4b, 8b
LFM 2VLM450m, 1.6b, 3b.
WhisperASRsmall

Обмеження

Тип обмеженняОпис.
Архітектура моделі.Підтримуються лише моделі, що базуються на описаних вище архітектурах.
Параметри моделі.Підтримуються лише моделі, кількість параметрів яких становить менше 10 мільярдів.
Моделі HFМоделі мають бути доступні у вигляді локальної директорії Hugging Face, яка містить config.json, файли з вагами у форматі safetensor, а також файли токенізатора та процесора, необхідні для даної архітектури. generation_config.json є необов’язковим.
GGUF МоделіФормат GGUF підтримується лише для LLM. VLM необхідно скомпілювати з формату Hugging Face safetensors. Зверніть увагу, що продуктивність може знизитися порівняно з компіляцією Hugging Face safetensor.
Стиснені тензорні моделі.Підтримувані LLM та VLM можуть використовувати попередньо квантовані моделі safetensor (GPTQ/AWQ), створені за допомогою llm-compressor. Модель повинна використовувати симетричне квантування та підтримуваний формат compressed-tensors. Ці моделі можуть досягати кращої точності, ніж стандартне INT4 квантування, зберігаючи при цьому високу продуктивність.
Gemma3 VLMПідтримується модифікований кодувальник зображень SigLip 448.
LLAMA 3.2. Можливості візуального сприйняттяМоделі комп’ютерного зору не підтримуються.