Files
aha/docs/supported-models.zh-CN.md
T

9.2 KiB
Raw Blame History

支持的模型

aha 支持多个领域的最先进 AI 模型集合。

文本生成

模型 参数量 描述 使用场景 开源协议
Qwen3-0.6B 0.6B 最新一代 高级推理 Apache 2.0
MiniCPM4-0.5B 0.5B 高效轻量级 边缘部署 Apache 2.0

Embedding

模型 参数量 描述 开源协议
Qwen3-Embedding-0.6B 0.6B 文本向量(safetensors Apache 2.0
Qwen3-Embedding-4B 4B 文本向量(safetensors Apache 2.0
Qwen3-Embedding-8B 8B 文本向量(safetensors Apache 2.0

Reranker

模型 参数量 描述 开源协议
Qwen3-Reranker-0.6B 0.6B 文本重排(基于 embedding 相似度的基线实现,safetensors Apache 2.0
Qwen3-Reranker-4B 4B 文本重排(基于 embedding 相似度的基线实现,safetensors Apache 2.0
Qwen3-Reranker-8B 8B 文本重排(基于 embedding 相似度的基线实现,safetensors Apache 2.0

视觉与多模态

模型 参数量 描述 开源协议
Qwen2.5-VL-3B 3B 图像理解 Qwen 研究许可协议
Qwen2.5-VL-7B 7B 图像理解 Apache 2.0
Qwen3-VL-2B 2B 增强多模态 Apache 2.0
Qwen3-VL-4B 4B 增强多模态 Apache 2.0
Qwen3-VL-8B 8B 增强多模态 Apache 2.0
Qwen3-VL-32B 32B 增强多模态 Apache 2.0
Qwen3.5-0.8B 0.8B 原生多模态 Apache 2.0
Qwen3.5-2B 2B 原生多模态 Apache 2.0
Qwen3.5-4B 4B 原生多模态 Apache 2.0
Qwen3.5-9B 9B 原生多模态 Apache 2.0
Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2 9B Qwen3.5 同构蒸馏版本 HF 页面许可证

Qwen3.5 GGUF 仓库来源(复用现有运行时)

  • Jackrong/Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF
  • Jackrong/Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF
  • unsloth/Qwen3.5-0.8B-GGUF
  • unsloth/Qwen3.5-2B-GGUF
  • unsloth/Qwen3.5-4B-GGUF
  • lmstudio-community/Qwen3.5-0.8B-GGUF
  • lmstudio-community/Qwen3.5-2B-GGUF
  • lmstudio-community/Qwen3.5-4B-GGUF

OCR

模型 语言 类型 优势 开源协议
PaddleOCR-VL 多语言 轻量级 通用文档 Apache 2.0
PaddleOCR-VL1.5 多语言 轻量级 通用文档 Apache 2.0
Hunyuan-OCR 中文 深度学习 复杂布局 腾讯混元社区许可协议
DeepSeek-OCR 多语言 场景文字 自然图像 MIT
GLM-OCR 8 场景文字 复杂文档 MIT

语音识别 (ASR)

模型 参数量 语言 实时 速度 开源协议
Fun-ASR-Nano-2512 2512M 中/英 快速 未标明
GLM-ASR-Nano-2512 2512M 中/英 快速 MIT
Qwen3-ASR-0.6B 0.6B 中/英 快速 Apache 2.0
Qwen3-ASR-1.7B 1.7B 中/英 快速 Apache 2.0

语音生成

模型 参数量 类型 描述 开源协议
VoxCPM-0.5B 0.5B 语音编解码器 神经音频编解码 Apache 2.0
VoxCPM1.5 - 语音编解码器 增强语音生成 Apache 2.0

图像处理

模型 类型 描述 开源协议
RMBG-2.0 背景移除 移除图像背景 CC BY-NC 4.0

模型来源

模型来源:

已收录仓库(当前运行时暂未直接接入)

以下仓库已纳入项目模型目录,但当前 aha 运行时尚不能直接推理:

MLX / 特定格式变体

  • Jackrong/MLX-Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-4bit
  • Jackrong/MLX-Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-4bit
  • Jackrong/MLX-Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-6bit
  • Jackrong/MLX-Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-8bit
  • Jackrong/MLX-Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-v2-4bit
  • Jackrong/MLX-Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-v2-6bit
  • Jackrong/MLX-Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-v2-8bit

Embedding 模型

  • google/embeddinggemma-300m
  • ggml-org/embeddinggemma-300M-GGUF
  • onnx-community/embeddinggemma-300m-ONNX
  • unsloth/embeddinggemma-300m-GGUF
  • onnx-community/Qwen3-Embedding-0.6B-ONNX
  • Qwen/Qwen3-Embedding-0.6B-GGUF
  • onnx-community/Qwen3-Embedding-4B-ONNX
  • Qwen/Qwen3-Embedding-4B-GGUF
  • Qwen/Qwen3-Embedding-8B-GGUF
  • onnx-community/Qwen3-Embedding-8B-ONNX
  • perplexity-ai/pplx-embed-v1-0.6b
  • nomic-ai/nomic-embed-text-v2-moe
  • nomic-ai/nomic-embed-text-v2-moe-GGUF
  • jinaai/jina-embeddings-v5-text-small
  • jinaai/jina-embeddings-v5-text-nano
  • jinaai/jina-embeddings-v5-text-small-text-matching
  • jinaai/jina-embeddings-v5-text-small-text-matching-GGUF
  • sentence-transformers/all-MiniLM-L6-v2
  • sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2

Reranker 模型

  • BAAI/bge-reranker-v2-m3
  • ggml-org/Qwen3-Reranker-0.6B-Q8_0-GGUF

ONNX 仓库

  • onnx-community/GLM-OCR-ONNX
  • onnx-community/Qwen3-Reranker-0.6B-ONNX
  • onnx-community/Qwen3.5-2B-ONNX
  • onnx-community/Qwen3.5-4B-ONNX
  • onnx-community/Qwen3.5-0.8B-ONNX
  • onnx-community/Qwen3-VL-2B-Instruct-ONNX
  • onnx-community/ONNX_Qwen3-Embedding-0.6B
  • onnx-community/Nanbeige4.1-3B-ONNX
  • onnx-community/Qwen3-Embedding-8B-ONNX
  • onnx-community/Qwen3-Embedding-4B-ONNX
  • onnx-community/bge-reranker-v2-m3-ONNX
  • onnx-community/all-MiniLM-L6-v2-ONNX

添加新模型

参见 开发指南 了解添加新模型集成的说明。

许可证合规

重要提示:每个模型都有自己的许可证。在生产环境使用前请查看模型许可证。一些关键注意事项:

  • Apache 2.0: 宽松许可,支持商业使用
  • MIT: 宽松许可,支持商业使用
  • Qwen 研究许可协议: 研究用途,可能有使用限制
  • 腾讯混元社区许可协议: 自定义许可,请查看条款
  • CC BY-NC 4.0: 仅限非商业用途

在生产环境部署前,请务必验证许可证条款。

模型更新

模型不定期更新。

性能基准

CPU (M1 Pro) 上的近似推理速度:

模型 任务 Tokens/秒
Qwen3-0.6B 文本 40-50
Qwen2.5-VL-3B 视觉 20-30
Qwen3-ASR-0.6B ASR 200-500x
VoxCPM-0.5B TTS 实时

基准测试因硬件和输入大小而异。