GenAI з використанням LLiMa
LLiMa — це набір інструментів GenAI у Model Compiler, призначений для компіляції, тестування, проведення тестів продуктивності й розгортання моделей LLM, VLM та ASR, а також для їх запуску на платформі Modalix.
LLiMa підтримує три формати вхідних даних:
- Hugging Face safetensors — стандартні каталоги для моделей LLM та VLM.
- Файли GGUF — моделі LLM, упаковані у формат GGUF.
- Стиснені тензорні моделі — попередньо квантовані моделі у форматі safetensor, що використовують методи GPTQ/AWQ.
SiMa.ai також публікує попередньо скомпільовані GenAI моделі на Hugging Face . Почніть звідти, якщо вже існує відповідна модель.
Для перегляду конкретних демонстрацій GenAI, див. приклади .
LLiMa Наявність
Інструменти для компіляції LLiMa встановлюються за замовчуванням у Model Compiler. LLiMa runtime встановлюється нативно в Modalix як частина Neat runtime. Див. Neat Framework installation для отримання інформації про процес встановлення runtime.
Беручи участь / Вносячи свій внесок
Автори, які вносять зміни безпосередньо до LLiMa, повинні дотримуватися Посібника для авторів LLiMa щодо структури репозиторію, середовищ розробки, рівнів тестування, політики щодо вхідних даних для моделі та вимог до запитів на внесення змін.
Підтримувані моделі
Наступна таблиця містить інформацію про підтримувані архітектури моделей та їхні можливості:
| Архітектура моделі. | Тип | Підтримувані розміри |
|---|---|---|
| Llama 2 | LLM | 7b |
| Llama 3.1 | LLM | 8b |
| Llama 3.2 | LLM | 1b, 3b |
| Gemma 1 | LLM | 2b, 7b |
| Gemma 2 | LLM | 2b, 9b |
| Gemma 3 | LLM | 1b, 4b |
| Phi 3.5 mini | LLM | 3.8b |
| Phi 4 mini | LLM | 3.8b |
| Qwen 2.5 | LLM | 0.5b, 1.5b, 3b, 7b |
| Qwen 3 | LLM | 0.6b, 1.7b, 4b, 8b |
| Mistral 1 | LLM | 7b |
| LFM 2 | LLM | 350m, 1.2b, 2.6b. |
| Llava 1.5 | VLM | 7b |
| PaliGemma | VLM | 3b |
| Gemma 3 | VLM | 4b |
| Gemma 4 | VLM | E2B, E4B |
| Qwen 2.5 VL | VLM | 3b, 7b |
| Qwen 3 VL | VLM | 2b, 4b, 8b |
| LFM 2 | VLM | 450m, 1.6b, 3b. |
| Whisper | ASR | small |
Обмеження
| Тип обмеження | Опис. |
|---|---|
| Архітектура моделі. | Підтримуються лише моделі, що базуються на описаних вище архітектурах. |
| Параметри моделі. | Підтримуються лише моделі, кількість параметрів яких становить менше 10 мільярдів. |
| Моделі HF | Моделі мають бути доступні у вигляді локальної директорії Hugging Face, яка містить config.json, файли з вагами у форматі safetensor, а також файли токенізатора та процесора, необхідні для даної архітектури. generation_config.json є необов’язковим. |
| GGUF Моделі | Формат GGUF підтримується лише для LLM. VLM необхідно скомпілювати з формату Hugging Face safetensors. Зверніть увагу, що продуктивність може знизитися порівняно з компіляцією Hugging Face safetensor. |
| Стиснені тензорні моделі. | Підтримувані LLM та VLM можуть використовувати попередньо квантовані моделі safetensor (GPTQ/AWQ), створені за допомогою llm-compressor. Модель повинна використовувати симетричне квантування та підтримуваний формат compressed-tensors. Ці моделі можуть досягати кращої точності, ніж стандартне INT4 квантування, зберігаючи при цьому високу продуктивність. |
| Gemma3 VLM | Підтримується модифікований кодувальник зображень SigLip 448. |
| LLAMA 3.2. Можливості візуального сприйняття | Моделі комп’ютерного зору не підтримуються. |