GenAI와 LLiMa
LLiMa는 Model Compiler 내의 GenAI 도구 모음으로, LLM, VLM 및 ASR 모델을 컴파일, 테스트, 벤치마크 및 배포하고 Modalix에서 실행하는 데 사용됩니다.
LLiMa는 세 가지 입력 형식을 지원합니다.
- Hugging Face safetensors — 표준 LLM 및 VLM 모델 디렉터리
- GGUF 파일 — GGUF 형식으로 패키징된 LLM 모델
- 압축된 텐서 모델 — 미리 양자화된 GPTQ/AWQ 스타일의 세이프텐서 모델
SiMa.ai는 또한 GenAI 모델을 미리 컴파일하여 Hugging Face 에 게시합니다. 적절한 모델이 이미 존재하는 경우 해당 위치에서 시작하세요.
구체적인 GenAI 데모는 예제 를 참조하세요.
LLiMa 사용 가능 여부
LLiMa 컴파일 도구는 기본적으로 Model Compiler에 설치됩니다. LLiMa 런타임은 Neat 런타임의 일부로 Modalix에 기본적으로 설치됩니다. 런타임 설치 흐름에 대해서는 Neat Framework 설치를 참조하십시오.
기여
LLiMa 자체를 수정하는 기여자는 저장소 구조, 개발 환경, 테스트 단계, 모델 입력 정책 및 풀 리퀘스트 요구 사항에 대해 LLiMa 기여자 가이드 를 따라야 합니다.
지원되는 모델
다음 표는 지원되는 모델 아키텍처와 해당 기능 목록을 보여줍니다.
| 모델 아키텍처 | 유형 | 지원되는 크기 |
|---|---|---|
| Llama 2 | LLM | 7b |
| Llama 3.1 | LLM | 8b |
| Llama 3.2 | LLM | 1b, 3b |
| Gemma 1 | LLM | 2b, 7b |
| Gemma 2 | LLM | 2b, 9b |
| Gemma 3 | LLM | 1b, 4b |
| Phi 3.5 미니 | LLM | 3.8b |
| Phi 4 미니 | LLM | 3.8b |
| Qwen 2.5 | LLM | 0.5b, 1.5b, 3b, 7b |
| Qwen 3 | LLM | 0.6b, 1.7b, 4b, 8b |
| Mistral 1 | LLM | 7b |
| LFM 2 | LLM | 350m, 1.2b, 2.6b |
| Llava 1.5 | VLM | 7b |
| PaliGemma | VLM | 3b |
| Gemma 3 | VLM | 4b |
| Gemma 4 | VLM | E2B, E4B |
| Qwen 2.5 VL | VLM | 3b, 7b |
| Qwen 3 VL | VLM | 2b, 4b, 8b |
| LFM 2 | VLM | 450m, 1.6b, 3b |
| Whisper | ASR | small |
제한 사항
| 제한 유형 | 설명 |
|---|---|
| 모델 아키텍처 | 위에 나열된 아키텍처를 기반으로 하는 모델만 지원됩니다. |
| 모델 파라미터 | 100억 개 미만의 파라미터 수를 가진 모델만 지원됩니다. |
| HF 모델 | 모델은 config.json, 안전 텐서 가중치, 그리고 해당 아키텍처에서 요구하는 토크나이저 및 프로세서 파일을 포함하는 로컬 Hugging Face 디렉터리로 제공되어야 합니다. generation_config.json은 선택 사항입니다. |
| GGUF 모델 | GGUF 형식은 LLM에만 적용됩니다. VLM은 Hugging Face의 safetensors 형식으로 컴파일해야 합니다. 성능은 Hugging Face safetensor 컴파일에 비해 저하될 수 있다는 점에 유의하십시오. |
| 압축된 텐서 모델 | 지원되는 LLM 및 VLM은 llm-compressor를 사용하여 생성된 사전 양자화된 safetensor 모델(GPTQ/AWQ)을 사용할 수 있습니다. 모델은 대칭 양자화를 사용하고 지원되는 compressed-tensors 레이아웃을 사용해야 합니다. 이러한 모델은 높은 성능을 유지하면서 표준 INT4 양자화보다 더 나은 정확도를 달성할 수 있습니다. |
| Gemma3 VLM | 수정된 SigLip 448 비전 인코더를 지원합니다. |
| 라마 3.2 비전 | 비전 모델은 지원되지 않습니다. |