Files
aha/docs/supported-models.zh-CN.md
T
2026-03-31 18:45:01 +08:00

4.8 KiB

支持的模型

aha 支持多个领域的最先进 AI 模型集合。

文本生成

模型 参数量 模型id 开源协议
Qwen3-0.6B 0.6B Qwen/Qwen3-0.6B Apache 2.0
MiniCPM4-0.5B 0.5B OpenBMB/MiniCPM4-0.5B Apache 2.0
LFM2-1.2B 1.2B LiquidAI/LFM2-1.2B lfm1.0
LFM2.5-1.2B-Instruct 1.2B LiquidAI/LFM2.5-1.2B-Instruct lfm1.0

视觉与多模态

模型 参数量 模型id 开源协议
Qwen2.5-VL 3B
7B
Qwen/Qwen2.5-VL-3B-Instruct
Qwen/Qwen2.5-VL-7B-Instruct
Qwen 研究许可协议
Apache 2.0
Qwen3-VL 2B
4B
8B
32B
Qwen/Qwen3-VL-2B-Instruct
Qwen/Qwen3-VL-4B-Instruct
Qwen/Qwen3-VL-8B-Instruct
Qwen/Qwen3-VL-32B-Instruct
Apache 2.0
Qwen3.5 0.8B
2B
4B
9B
Qwen/Qwen3.5-0.8B
Qwen/Qwen3.5-2B
Qwen/Qwen3.5-4B
Qwen/Qwen3.5-9B
Apache 2.0
LFM2.5-VL-1.6B 1.6B LiquidAI/LFM2.5-VL-1.6B lfm1.0
LFM2-VL-1.6B 1.6B LiquidAI/LFM2-VL-1.6B lfm1.0

OCR

模型 语言 模型id 开源协议
PaddleOCR-VL 多语言 PaddlePaddle/PaddleOCR-VL
PaddlePaddle/PaddleOCR-VL-1.5
Apache 2.0
Hunyuan-OCR 中文 Tencent-Hunyuan/HunyuanOCR 腾讯混元社区许可协议
DeepSeek-OCR 多语言 deepseek-ai/DeepSeek-OCR
deepseek-ai/DeepSeek-OCR-2
MIT
GLM-OCR 8 ZhipuAI/GLM-OCR MIT

语音识别 (ASR)

模型 参数量 语言 模型id 开源协议
Fun-ASR-Nano-2512 - 中/英 FunAudioLLM/Fun-ASR-Nano-2512 未标明
GLM-ASR-Nano-2512 - 中/英 ZhipuAI/GLM-ASR-Nano-2512 MIT
Qwen3-ASR 0.6B
1.7B
中/英 Qwen/Qwen3-ASR-0.6B
Qwen/Qwen3-ASR-1.7B
Apache 2.0

语音生成

模型 版本 模型id 开源协议
VoxCPM 1
1.5
OpenBMB/VoxCPM-0.5B
OpenBMB/VoxCPM1.5
Apache 2.0

图像处理

模型 类型 模型id 开源协议
RMBG-2.0 背景移除 AI-ModelScope/RMBG-2.0 CC BY-NC 4.0

模型来源

模型来源:

添加新模型

参见 开发指南 了解添加新模型集成的说明。

许可证合规

重要提示:每个模型都有自己的许可证。在生产环境使用前请查看模型许可证。一些关键注意事项:

  • Apache 2.0: 宽松许可,支持商业使用
  • MIT: 宽松许可,支持商业使用
  • Qwen 研究许可协议: 研究用途,可能有使用限制
  • 腾讯混元社区许可协议: 自定义许可,请查看条款
  • CC BY-NC 4.0: 仅限非商业用途

在生产环境部署前,请务必验证许可证条款。

模型更新

模型不定期更新。

性能基准

CPU (M1 Pro) 上的近似推理速度:

模型 任务 Tokens/秒
Qwen3-0.6B 文本 40-50
Qwen2.5-VL-3B 视觉 20-30
Qwen3-ASR-0.6B ASR 200-500x
VoxCPM-0.5B TTS 实时

基准测试因硬件和输入大小而异。