Files
aha/docs/supported-models.md
T
2026-03-31 18:45:01 +08:00

4.9 KiB

Supported Models

aha supports a growing collection of state-of-the-art AI models across multiple domains.

Language Model

Model Parameters Model Id License
Qwen3-0.6B 0.6B Qwen/Qwen3-0.6B Apache 2.0
MiniCPM4-0.5B 0.5B OpenBMB/MiniCPM4-0.5B Apache 2.0
LFM2-1.2B 1.2B LiquidAI/LFM2-1.2B lfm1.0
LFM2.5-1.2B-Instruct 1.2B LiquidAI/LFM2.5-1.2B-Instruct lfm1.0

Vision & Multimodal

Model Parameters Model Id License
Qwen2.5-VL 3B
7B
Qwen/Qwen2.5-VL-3B-Instruct
Qwen/Qwen2.5-VL-7B-Instruct
Qwen 研究许可协议
Apache 2.0
Qwen3-VL 2B
4B
8B
32B
Qwen/Qwen3-VL-2B-Instruct
Qwen/Qwen3-VL-4B-Instruct
Qwen/Qwen3-VL-8B-Instruct
Qwen/Qwen3-VL-32B-Instruct
Apache 2.0
Qwen3.5 0.8B
2B
4B
9B
Qwen/Qwen3.5-0.8B
Qwen/Qwen3.5-2B
Qwen/Qwen3.5-4B
Qwen/Qwen3.5-9B
Apache 2.0
LFM2.5-VL-1.6B 1.6B LiquidAI/LFM2.5-VL-1.6B lfm1.0
LFM2-VL-1.6B 1.6B LiquidAI/LFM2-VL-1.6B lfm1.0

OCR

Model Languages Model Id License
PaddleOCR-VL Multi PaddlePaddle/PaddleOCR-VL
PaddlePaddle/PaddleOCR-VL-1.5
Apache 2.0
Hunyuan-OCR Chinese Tencent-Hunyuan/HunyuanOCR Tencent Hunyuan Community License
DeepSeek-OCR Multi deepseek-ai/DeepSeek-OCR
deepseek-ai/DeepSeek-OCR-2
MIT
GLM-OCR 8 ZhipuAI/GLM-OCR MIT

Speech Recognition (ASR)

Model Parameters Language Model Id License
Fun-ASR-Nano-2512 2G Chinese/English FunAudioLLM/Fun-ASR-Nano-2512 Not Specified
GLM-ASR-Nano-2512 4.5G Chinese/English ZhipuAI/GLM-ASR-Nano-2512 MIT
Qwen3-ASR 0.6B
1.7B
Chinese/English Qwen/Qwen3-ASR-0.6B
Qwen/Qwen3-ASR-1.7B
Apache 2.0

Audio Generation

Model version Model Id License
VoxCPM 1
1.5
OpenBMB/VoxCPM-0.5B
OpenBMB/VoxCPM1.5
Apache 2.0

Image Processing

Model Type Model Id License
RMBG-2.0 Background Removal AI-ModelScope/RMBG-2.0 CC BY-NC 4.0

Model Sources

Models are sourced from:

Adding New Models

See Development Guide for instructions on adding new model integrations.

License Compliance

Important: Each model has its own license. Please review the model's license before use in production. Some key considerations:

  • Apache 2.0: Permissive, commercial-friendly
  • MIT: Permissive, commercial-friendly
  • Qwen Research License: Research use, may have restrictions
  • Tencent Hunyuan Community License: Custom license, review terms
  • CC BY-NC 4.0: Non-commercial only

Always verify license terms before deployment in production environments.

Model Updates

Models updated from time to time.

Performance Benchmarks

Approximate inference speeds on CPU (M1 Pro):

Model Task Tokens/sec
Qwen3-0.6B Text 40-50
Qwen2.5-VL-3B Vision 20-30
Qwen3-ASR-0.6B ASR 200-500x
VoxCPM-0.5B TTS Real-time

Benchmarks vary by hardware and input size.