update doc
This commit is contained in:
@@ -24,36 +24,26 @@
|
||||
|
||||
aha is a high-performance, cross-platform AI inference engine built with Rust and the Candle framework. It brings state-of-the-art AI models to your local machine—no API keys, no cloud dependencies, just pure, fast AI running directly on your hardware.
|
||||
|
||||
## Changelog
|
||||
### 2026-03-31
|
||||
- aha model name use modelscope id replace
|
||||
- update WhichModel
|
||||
- Usage add time info
|
||||
- dependencies delete aha_openai_dive,chrono
|
||||
|
||||
### v0.2.5 (2026-03-30)
|
||||
- add LFM2.5VL-1.6B
|
||||
- add LFM2VL-1.6B
|
||||
### Supported Models
|
||||
|
||||
### v0.2.4 (2026-03-23)
|
||||
- add LFM2.5-1.2B-Instruct
|
||||
- add LFM2-1.2B
|
||||
| Category | Models |
|
||||
|----------|--------|
|
||||
| **Text** | Qwen3, MiniCPM4, <br> LFM2, LFM2.5 |
|
||||
| **Vision** | Qwen2.5-VL, Qwen3-VL, Qwen3.5, <br> LFM2.5-VL, LFM2-VL |
|
||||
| **OCR** | DeepSeek-OCR, DeepSeek-OCR-2 , <br> PaddleOCR-VL, PaddleOCR-VL1.5, <br> Hunyuan-OCR, GLM-OCR |
|
||||
| **ASR** | GLM-ASR-Nano, Fun-ASR-Nano, Qwen3-ASR |
|
||||
| **Audio** | VoxCPM, VoxCPM1.5 |
|
||||
| **Image** | RMBG-2.0 (background removal) |
|
||||
|
||||
### v0.2.3 (2026-03-18)
|
||||
- add DeepSeek-OCR-2
|
||||
|
||||
### 2026-03-17
|
||||
- add PaddleOCR-VL1.5 model
|
||||
- fix qwen3.5 position_ids create bug
|
||||
- cli param add
|
||||
- gguf_path: Local GGUF model weight path (required for loading models with GGUF)
|
||||
- mmproj_path: Local path to mmproj GGUF weights (required for multimodal GGUF loading)
|
||||
- WhichModel add qwen3.5-gguf
|
||||
|
||||
### 2026-03-16
|
||||
- Added Qwen3.5 mmproj
|
||||
|
||||
**[View full changelog](docs/changelog.md)** →
|
||||
## Why aha?
|
||||
- **🚀 High-Performance Inference** - Powered by Candle framework for efficient tensor computation and model inference
|
||||
- **🔧 Unified Interface** — One tool for text, vision, speech, and OCR
|
||||
- **📦 Local-First** — All processing runs locally, no data leaves your machine
|
||||
- **🎯 Cross-Platform** — Works on Linux, macOS, and Windows
|
||||
- **⚡ GPU Accelerated** — Optional CUDA support for faster inference
|
||||
- **🛡️ Memory Safe** — Built with Rust for reliability
|
||||
- **🧠 Attention Optimization** - Optional Flash Attention support for optimized long sequence processing
|
||||
|
||||
## Quick Start
|
||||
|
||||
@@ -111,7 +101,7 @@ aha serv -m Qwen/Qwen3-0.6B -p 10100
|
||||
Then use the unified (OpenAI-compatible) API:
|
||||
|
||||
```bash
|
||||
curl http://localhost:10100/chat/completions \
|
||||
curl http://localhost:10100/v1/chat/completions \
|
||||
-H "Content-Type: application/json" \
|
||||
-d '{
|
||||
"model": "Qwen/Qwen3-0.6B",
|
||||
@@ -121,16 +111,38 @@ curl http://localhost:10100/chat/completions \
|
||||
'
|
||||
```
|
||||
|
||||
### Supported Models
|
||||
## Changelog
|
||||
|
||||
### 2026-03-31
|
||||
- aha model name use modelscope id replace
|
||||
- update WhichModel
|
||||
- Usage add time info
|
||||
- dependencies delete aha_openai_dive,chrono
|
||||
|
||||
### v0.2.5 (2026-03-30)
|
||||
- add LFM2.5VL-1.6B
|
||||
- add LFM2VL-1.6B
|
||||
|
||||
### v0.2.4 (2026-03-23)
|
||||
- add LFM2.5-1.2B-Instruct
|
||||
- add LFM2-1.2B
|
||||
|
||||
### v0.2.3 (2026-03-18)
|
||||
- add DeepSeek-OCR-2
|
||||
|
||||
### 2026-03-17
|
||||
- add PaddleOCR-VL1.5 model
|
||||
- fix qwen3.5 position_ids create bug
|
||||
- cli param add
|
||||
- gguf_path: Local GGUF model weight path (required for loading models with GGUF)
|
||||
- mmproj_path: Local path to mmproj GGUF weights (required for multimodal GGUF loading)
|
||||
- WhichModel add qwen3.5-gguf
|
||||
|
||||
### 2026-03-16
|
||||
- Added Qwen3.5 mmproj
|
||||
|
||||
**[View full changelog](docs/changelog.md)** →
|
||||
|
||||
| Category | Models |
|
||||
|----------|--------|
|
||||
| **Text** | Qwen3, MiniCPM4, <br> LFM2, LFM2.5 |
|
||||
| **Vision** | Qwen2.5-VL, Qwen3-VL, Qwen3.5, <br> LFM2.5-VL, LFM2-VL |
|
||||
| **OCR** | DeepSeek-OCR, DeepSeek-OCR-2 , <br> PaddleOCR-VL, PaddleOCR-VL1.5, <br> Hunyuan-OCR, GLM-OCR |
|
||||
| **ASR** | GLM-ASR-Nano, Fun-ASR-Nano, Qwen3-ASR |
|
||||
| **Audio** | VoxCPM, VoxCPM1.5 |
|
||||
| **Image** | RMBG-2.0 (background removal) |
|
||||
|
||||
## Documentation
|
||||
|
||||
@@ -145,14 +157,6 @@ curl http://localhost:10100/chat/completions \
|
||||
| [Development](docs/development.md) | Contributing guide |
|
||||
| [Changelog](docs/changelog.md) | Version history |
|
||||
|
||||
## Why aha?
|
||||
- **🚀 High-Performance Inference** - Powered by Candle framework for efficient tensor computation and model inference
|
||||
- **🔧 Unified Interface** — One tool for text, vision, speech, and OCR
|
||||
- **📦 Local-First** — All processing runs locally, no data leaves your machine
|
||||
- **🎯 Cross-Platform** — Works on Linux, macOS, and Windows
|
||||
- **⚡ GPU Accelerated** — Optional CUDA support for faster inference
|
||||
- **🛡️ Memory Safe** — Built with Rust for reliability
|
||||
- **🧠 Attention Optimization** - Optional Flash Attention support for optimized long sequence processing
|
||||
|
||||
## Development
|
||||
|
||||
|
||||
+46
-48
@@ -24,37 +24,25 @@
|
||||
|
||||
aha 是一款基于 Rust 和 Candle 框架构建的高性能跨平台 AI 推理引擎。将最先进的 AI 模型带到您的本地机器——无需 API 密钥,无需云依赖,纯粹、快速的 AI,直接在您的硬件上运行。
|
||||
|
||||
## 更新日志
|
||||
### 支持的模型
|
||||
|
||||
### 2026-03-31
|
||||
- aha模型名称使用 modelscope id 替换
|
||||
- 更新 WhichModel 枚举
|
||||
- Usage 增加时间信息
|
||||
- 删除 aha_openai_dive, chrono 依赖
|
||||
| 类别 | 模型 |
|
||||
|------|------|
|
||||
| **文本** | Qwen3, MiniCPM4, <br> LFM2, LFM2.5 |
|
||||
| **视觉** | Qwen2.5-VL, Qwen3-VL, Qwen3.5 <br> LFM2.5-VL, LFM2-VL |
|
||||
| **OCR** | DeepSeek-OCR, DeepSeek-OCR-2 , <br> PaddleOCR-VL, PaddleOCR-VL1.5, <br> Hunyuan-OCR, GLM-OCR |
|
||||
| **ASR** | GLM-ASR-Nano, Fun-ASR-Nano, Qwen3-ASR |
|
||||
| **音频** | VoxCPM, VoxCPM1.5 |
|
||||
| **图像** | RMBG-2.0 (背景移除) |
|
||||
|
||||
### v0.2.5 (2026-03-30)
|
||||
- 新增 LFM2.5VL-1.6B
|
||||
- 新增 LFM2VL-1.6B
|
||||
|
||||
### v0.2.4 (2026-03-23)
|
||||
- 新增 LFM2.5-1.2B-Instruct
|
||||
- 新增 LFM2-1.2B
|
||||
|
||||
### v0.2.3 (2026-03-18)
|
||||
- 新增 DeepSeek-OCR-2
|
||||
|
||||
### 2026-03-17
|
||||
- 新增 PaddleOCR-VL1.5 模型
|
||||
- 修复 qwen3.5 position_ids 创建错误
|
||||
- cli 参数增加
|
||||
- gguf_path: 本地 GGUF 模型权重路径(加载 GGUF 模型时需要)
|
||||
- mmproj_path: 本地 mmproj GGUF 权重路径(加载多模态 GGUF 时需要)
|
||||
- WhichModel 增加 qwen3.5-gguf
|
||||
|
||||
### 2026-03-16
|
||||
- 增加 Qwen3.5 mmproj
|
||||
|
||||
**[查看完整更新日志](docs/changelog.zh-CN.md)** →
|
||||
## 为什么选择 aha?
|
||||
- **🚀 高性能推理** - 基于 Candle 框架,提供高效的张量计算和模型推理
|
||||
- **🔧 统一接口** — 一个工具搞定文本、视觉、语音和 OCR
|
||||
- **📦 本地优先** — 所有处理在本地运行,数据不离境
|
||||
- **🎯 跨平台** — 支持 Linux、macOS 和 Windows
|
||||
- **⚡ GPU 加速** — 可选 CUDA 支持以获得更快推理
|
||||
- **🛡️ 内存安全** — Rust 构建,稳定可靠
|
||||
- **🧠 注意力优化** - 可选 Flash Attention 支持,优化长序列处理
|
||||
|
||||
## 快速开始
|
||||
|
||||
@@ -112,7 +100,7 @@ aha serv -m Qwen/Qwen3-0.6B -p 10100
|
||||
然后使用统一(兼容 OpenAI)的 API:
|
||||
|
||||
```bash
|
||||
curl http://localhost:10100/chat/completions \
|
||||
curl http://localhost:10100/v1/chat/completions \
|
||||
-H "Content-Type: application/json" \
|
||||
-d '{
|
||||
"model": "Qwen/Qwen3-0.6B",
|
||||
@@ -121,18 +109,37 @@ curl http://localhost:10100/chat/completions \
|
||||
}'
|
||||
```
|
||||
|
||||
## 更新日志
|
||||
|
||||
### 支持的模型
|
||||
### 2026-03-31
|
||||
- aha模型名称使用 modelscope id 替换
|
||||
- 更新 WhichModel 枚举
|
||||
- Usage 增加时间信息
|
||||
- 删除 aha_openai_dive, chrono 依赖
|
||||
|
||||
| 类别 | 模型 |
|
||||
|------|------|
|
||||
| **文本** | Qwen3, MiniCPM4, <br> LFM2, LFM2.5 |
|
||||
| **视觉** | Qwen2.5-VL, Qwen3-VL, Qwen3.5 <br> LFM2.5-VL, LFM2-VL |
|
||||
| **OCR** | DeepSeek-OCR, DeepSeek-OCR-2 , <br> PaddleOCR-VL, PaddleOCR-VL1.5, <br> Hunyuan-OCR, GLM-OCR |
|
||||
| **ASR** | GLM-ASR-Nano, Fun-ASR-Nano,Qwen3-ASR |
|
||||
| **音频** | VoxCPM, VoxCPM1.5 |
|
||||
| **图像** | RMBG-2.0 (背景移除) |
|
||||
### v0.2.5 (2026-03-30)
|
||||
- 新增 LFM2.5VL-1.6B
|
||||
- 新增 LFM2VL-1.6B
|
||||
|
||||
### v0.2.4 (2026-03-23)
|
||||
- 新增 LFM2.5-1.2B-Instruct
|
||||
- 新增 LFM2-1.2B
|
||||
|
||||
### v0.2.3 (2026-03-18)
|
||||
- 新增 DeepSeek-OCR-2
|
||||
|
||||
### 2026-03-17
|
||||
- 新增 PaddleOCR-VL1.5 模型
|
||||
- 修复 qwen3.5 position_ids 创建错误
|
||||
- cli 参数增加
|
||||
- gguf_path: 本地 GGUF 模型权重路径(加载 GGUF 模型时需要)
|
||||
- mmproj_path: 本地 mmproj GGUF 权重路径(加载多模态 GGUF 时需要)
|
||||
- WhichModel 增加 qwen3.5-gguf
|
||||
|
||||
### 2026-03-16
|
||||
- 增加 Qwen3.5 mmproj
|
||||
|
||||
**[查看完整更新日志](docs/changelog.zh-CN.md)** →
|
||||
|
||||
## 文档
|
||||
|
||||
@@ -147,15 +154,6 @@ curl http://localhost:10100/chat/completions \
|
||||
| [开发指南](docs/development.zh-CN.md) | 贡献指南 |
|
||||
| [更新日志](docs/changelog.zh-CN.md) | 版本历史 |
|
||||
|
||||
## 为什么选择 aha?
|
||||
- **🚀 高性能推理** - 基于 Candle 框架,提供高效的张量计算和模型推理
|
||||
- **🔧 统一接口** — 一个工具搞定文本、视觉、语音和 OCR
|
||||
- **📦 本地优先** — 所有处理在本地运行,数据不离境
|
||||
- **🎯 跨平台** — 支持 Linux、macOS 和 Windows
|
||||
- **⚡ GPU 加速** — 可选 CUDA 支持以获得更快推理
|
||||
- **🛡️ 内存安全** — Rust 构建,稳定可靠
|
||||
- **🧠 注意力优化** - 可选 Flash Attention 支持,优化长序列处理
|
||||
|
||||
## 开发
|
||||
|
||||
### aha 作为库使用
|
||||
|
||||
+34
-35
@@ -277,43 +277,42 @@ aha list
|
||||
|
||||
Expected output for `aha list`:
|
||||
|
||||
```
|
||||
```shell
|
||||
#Supported models:
|
||||
|
||||
Available models:
|
||||
Available models:
|
||||
|
||||
Model Name ModelScope ID
|
||||
-----------------------------------------------------------
|
||||
LiquidAI/LFM2-1.2B LiquidAI/LFM2-1.2B ✔
|
||||
LiquidAI/LFM2.5-1.2B-Instruct LiquidAI/LFM2.5-1.2B-Instruct ✔
|
||||
LiquidAI/LFM2.5-VL-1.6B LiquidAI/LFM2.5-VL-1.6B ✔
|
||||
LiquidAI/LFM2-VL-1.6B LiquidAI/LFM2-VL-1.6B ✔
|
||||
OpenBMB/MiniCPM4-0.5B OpenBMB/MiniCPM4-0.5B ✔
|
||||
Qwen/Qwen2.5-VL-3B-Instruct Qwen/Qwen2.5-VL-3B-Instruct ✔
|
||||
Qwen/Qwen2.5-VL-7B-Instruct Qwen/Qwen2.5-VL-7B-Instruct
|
||||
Qwen/Qwen3-0.6B Qwen/Qwen3-0.6B ✔
|
||||
Qwen/Qwen3.5-0.8B Qwen/Qwen3.5-0.8B ✔
|
||||
Qwen/Qwen3.5-2B Qwen/Qwen3.5-2B
|
||||
Qwen/Qwen3.5-4B Qwen/Qwen3.5-4B
|
||||
Qwen/Qwen3.5-9B Qwen/Qwen3.5-9B
|
||||
qwen3.5-gguf qwen3.5-gguf
|
||||
Qwen/Qwen3-ASR-0.6B Qwen/Qwen3-ASR-0.6B ✔
|
||||
Qwen/Qwen3-ASR-1.7B Qwen/Qwen3-ASR-1.7B
|
||||
Qwen/Qwen3-VL-2B-Instruct Qwen/Qwen3-VL-2B-Instruct ✔
|
||||
Qwen/Qwen3-VL-4B-Instruct Qwen/Qwen3-VL-4B-Instruct
|
||||
Qwen/Qwen3-VL-8B-Instruct Qwen/Qwen3-VL-8B-Instruct
|
||||
Qwen/Qwen3-VL-32B-Instruct Qwen/Qwen3-VL-32B-Instruct
|
||||
deepseek-ai/DeepSeek-OCR deepseek-ai/DeepSeek-OCR ✔
|
||||
deepseek-ai/DeepSeek-OCR-2 deepseek-ai/DeepSeek-OCR-2
|
||||
Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan/HunyuanOCR ✔
|
||||
PaddlePaddle/PaddleOCR-VL PaddlePaddle/PaddleOCR-VL ✔
|
||||
PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle/PaddleOCR-VL-1.5
|
||||
AI-ModelScope/RMBG-2.0 AI-ModelScope/RMBG-2.0 ✔
|
||||
OpenBMB/VoxCPM-0.5B OpenBMB/VoxCPM-0.5B ✔
|
||||
OpenBMB/VoxCPM1.5 OpenBMB/VoxCPM1.5 ✔
|
||||
ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI/GLM-ASR-Nano-2512 ✔
|
||||
FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM/Fun-ASR-Nano-2512 ✔
|
||||
ZhipuAI/GLM-OCR ZhipuAI/GLM-OCR
|
||||
Model ID Owner type Download
|
||||
--------------------------------------------------------------------------------
|
||||
LiquidAI/LFM2-1.2B LiquidAI llm ✔
|
||||
LiquidAI/LFM2.5-1.2B-Instruct LiquidAI llm ✔
|
||||
LiquidAI/LFM2.5-VL-1.6B LiquidAI vlm ✔
|
||||
LiquidAI/LFM2-VL-1.6B LiquidAI vlm ✔
|
||||
OpenBMB/MiniCPM4-0.5B OpenBMB llm ✔
|
||||
Qwen/Qwen2.5-VL-3B-Instruct Qwen vlm ✔
|
||||
Qwen/Qwen2.5-VL-7B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-0.6B Qwen llm ✔
|
||||
Qwen/Qwen3.5-0.8B Qwen vlm ✔
|
||||
Qwen/Qwen3.5-2B Qwen vlm
|
||||
Qwen/Qwen3.5-4B Qwen vlm
|
||||
Qwen/Qwen3.5-9B Qwen vlm
|
||||
qwen3.5-gguf none vlm
|
||||
Qwen/Qwen3-ASR-0.6B Qwen asr ✔
|
||||
Qwen/Qwen3-ASR-1.7B Qwen asr
|
||||
Qwen/Qwen3-VL-2B-Instruct Qwen vlm ✔
|
||||
Qwen/Qwen3-VL-4B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-VL-8B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-VL-32B-Instruct Qwen vlm
|
||||
deepseek-ai/DeepSeek-OCR deepseek-ai ocr ✔
|
||||
deepseek-ai/DeepSeek-OCR-2 deepseek-ai ocr
|
||||
Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan ocr ✔
|
||||
PaddlePaddle/PaddleOCR-VL PaddlePaddle ocr ✔
|
||||
PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle ocr
|
||||
AI-ModelScope/RMBG-2.0 AI-ModelScope image ✔
|
||||
OpenBMB/VoxCPM-0.5B OpenBMB tts ✔
|
||||
OpenBMB/VoxCPM1.5 OpenBMB tts ✔
|
||||
ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI asr ✔
|
||||
FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM asr ✔
|
||||
ZhipuAI/GLM-OCR ZhipuAI ocr ✔
|
||||
|
||||
```
|
||||
|
||||
|
||||
+33
-21
@@ -279,28 +279,40 @@ aha list
|
||||
```shell
|
||||
#Supported models:
|
||||
|
||||
Available models:
|
||||
Available models:
|
||||
|
||||
Model Name ModelScope ID
|
||||
-----------------------------------------------------------
|
||||
OpenBMB/MiniCPM4-0.5B OpenBMB/MiniCPM4-0.5B
|
||||
Qwen/Qwen2.5-VL-3B-Instruct Qwen/Qwen2.5-VL-3B-Instruct
|
||||
Qwen/Qwen2.5-VL-7B-Instruct Qwen/Qwen2.5-VL-7B-Instruct
|
||||
Qwen/Qwen3-0.6B Qwen/Qwen3-0.6B
|
||||
Qwen/Qwen3-ASR-0.6B Qwen/Qwen3-ASR-0.6B
|
||||
Qwen/Qwen3-ASR-1.7B Qwen/Qwen3-ASR-1.7B
|
||||
Qwen/Qwen3-VL-4B-Instruct Qwen/Qwen3-VL-2B-Instruct
|
||||
Qwen/Qwen3-VL-4B-Instruct Qwen/Qwen3-VL-4B-Instruct
|
||||
Qwen/Qwen3-VL-8B-Instruct Qwen/Qwen3-VL-8B-Instruct
|
||||
Qwen/Qwen3-VL-32B-Instruct Qwen/Qwen3-VL-32B-Instruct
|
||||
deepseek-ai/DeepSeek-OCR deepseek-ai/DeepSeek-OCR
|
||||
Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan/HunyuanOCR
|
||||
PaddlePaddle/PaddleOCR-VL PaddlePaddle/PaddleOCR-VL
|
||||
AI-ModelScope/RMBG-2.0 AI-ModelScope/RMBG-2.0
|
||||
voxcpm OpenBMB/VoxCPM-0.5B
|
||||
OpenBMB/VoxCPM1.5 OpenBMB/VoxCPM1.5
|
||||
ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI/GLM-ASR-Nano-2512
|
||||
FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM/Fun-ASR-Nano-2512
|
||||
Model ID Owner type Download
|
||||
--------------------------------------------------------------------------------
|
||||
LiquidAI/LFM2-1.2B LiquidAI llm ✔
|
||||
LiquidAI/LFM2.5-1.2B-Instruct LiquidAI llm ✔
|
||||
LiquidAI/LFM2.5-VL-1.6B LiquidAI vlm ✔
|
||||
LiquidAI/LFM2-VL-1.6B LiquidAI vlm ✔
|
||||
OpenBMB/MiniCPM4-0.5B OpenBMB llm ✔
|
||||
Qwen/Qwen2.5-VL-3B-Instruct Qwen vlm ✔
|
||||
Qwen/Qwen2.5-VL-7B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-0.6B Qwen llm ✔
|
||||
Qwen/Qwen3.5-0.8B Qwen vlm ✔
|
||||
Qwen/Qwen3.5-2B Qwen vlm
|
||||
Qwen/Qwen3.5-4B Qwen vlm
|
||||
Qwen/Qwen3.5-9B Qwen vlm
|
||||
qwen3.5-gguf none vlm
|
||||
Qwen/Qwen3-ASR-0.6B Qwen asr ✔
|
||||
Qwen/Qwen3-ASR-1.7B Qwen asr
|
||||
Qwen/Qwen3-VL-2B-Instruct Qwen vlm ✔
|
||||
Qwen/Qwen3-VL-4B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-VL-8B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-VL-32B-Instruct Qwen vlm
|
||||
deepseek-ai/DeepSeek-OCR deepseek-ai ocr ✔
|
||||
deepseek-ai/DeepSeek-OCR-2 deepseek-ai ocr
|
||||
Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan ocr ✔
|
||||
PaddlePaddle/PaddleOCR-VL PaddlePaddle ocr ✔
|
||||
PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle ocr
|
||||
AI-ModelScope/RMBG-2.0 AI-ModelScope image ✔
|
||||
OpenBMB/VoxCPM-0.5B OpenBMB tts ✔
|
||||
OpenBMB/VoxCPM1.5 OpenBMB tts ✔
|
||||
ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI asr ✔
|
||||
FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM asr ✔
|
||||
ZhipuAI/GLM-OCR ZhipuAI ocr ✔
|
||||
|
||||
```
|
||||
|
||||
|
||||
@@ -2,6 +2,43 @@
|
||||
|
||||
aha supports a growing collection of state-of-the-art AI models across multiple domains.
|
||||
|
||||
```shell
|
||||
Available models:
|
||||
|
||||
Model ID Owner type Download
|
||||
--------------------------------------------------------------------------------
|
||||
LiquidAI/LFM2-1.2B LiquidAI llm ✔
|
||||
LiquidAI/LFM2.5-1.2B-Instruct LiquidAI llm ✔
|
||||
LiquidAI/LFM2.5-VL-1.6B LiquidAI vlm ✔
|
||||
LiquidAI/LFM2-VL-1.6B LiquidAI vlm ✔
|
||||
OpenBMB/MiniCPM4-0.5B OpenBMB llm ✔
|
||||
Qwen/Qwen2.5-VL-3B-Instruct Qwen vlm ✔
|
||||
Qwen/Qwen2.5-VL-7B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-0.6B Qwen llm ✔
|
||||
Qwen/Qwen3.5-0.8B Qwen vlm ✔
|
||||
Qwen/Qwen3.5-2B Qwen vlm
|
||||
Qwen/Qwen3.5-4B Qwen vlm
|
||||
Qwen/Qwen3.5-9B Qwen vlm
|
||||
qwen3.5-gguf none vlm
|
||||
Qwen/Qwen3-ASR-0.6B Qwen asr ✔
|
||||
Qwen/Qwen3-ASR-1.7B Qwen asr
|
||||
Qwen/Qwen3-VL-2B-Instruct Qwen vlm ✔
|
||||
Qwen/Qwen3-VL-4B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-VL-8B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-VL-32B-Instruct Qwen vlm
|
||||
deepseek-ai/DeepSeek-OCR deepseek-ai ocr ✔
|
||||
deepseek-ai/DeepSeek-OCR-2 deepseek-ai ocr
|
||||
Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan ocr ✔
|
||||
PaddlePaddle/PaddleOCR-VL PaddlePaddle ocr ✔
|
||||
PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle ocr
|
||||
AI-ModelScope/RMBG-2.0 AI-ModelScope image ✔
|
||||
OpenBMB/VoxCPM-0.5B OpenBMB tts ✔
|
||||
OpenBMB/VoxCPM1.5 OpenBMB tts ✔
|
||||
ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI asr ✔
|
||||
FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM asr ✔
|
||||
ZhipuAI/GLM-OCR ZhipuAI ocr ✔
|
||||
```
|
||||
|
||||
## Language Model
|
||||
|
||||
| Model | Parameters | Model Id | License |
|
||||
|
||||
@@ -2,6 +2,43 @@
|
||||
|
||||
aha 支持多个领域的最先进 AI 模型集合。
|
||||
|
||||
```shell
|
||||
Available models:
|
||||
|
||||
Model ID Owner type Download
|
||||
--------------------------------------------------------------------------------
|
||||
LiquidAI/LFM2-1.2B LiquidAI llm ✔
|
||||
LiquidAI/LFM2.5-1.2B-Instruct LiquidAI llm ✔
|
||||
LiquidAI/LFM2.5-VL-1.6B LiquidAI vlm ✔
|
||||
LiquidAI/LFM2-VL-1.6B LiquidAI vlm ✔
|
||||
OpenBMB/MiniCPM4-0.5B OpenBMB llm ✔
|
||||
Qwen/Qwen2.5-VL-3B-Instruct Qwen vlm ✔
|
||||
Qwen/Qwen2.5-VL-7B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-0.6B Qwen llm ✔
|
||||
Qwen/Qwen3.5-0.8B Qwen vlm ✔
|
||||
Qwen/Qwen3.5-2B Qwen vlm
|
||||
Qwen/Qwen3.5-4B Qwen vlm
|
||||
Qwen/Qwen3.5-9B Qwen vlm
|
||||
qwen3.5-gguf none vlm
|
||||
Qwen/Qwen3-ASR-0.6B Qwen asr ✔
|
||||
Qwen/Qwen3-ASR-1.7B Qwen asr
|
||||
Qwen/Qwen3-VL-2B-Instruct Qwen vlm ✔
|
||||
Qwen/Qwen3-VL-4B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-VL-8B-Instruct Qwen vlm
|
||||
Qwen/Qwen3-VL-32B-Instruct Qwen vlm
|
||||
deepseek-ai/DeepSeek-OCR deepseek-ai ocr ✔
|
||||
deepseek-ai/DeepSeek-OCR-2 deepseek-ai ocr
|
||||
Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan ocr ✔
|
||||
PaddlePaddle/PaddleOCR-VL PaddlePaddle ocr ✔
|
||||
PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle ocr
|
||||
AI-ModelScope/RMBG-2.0 AI-ModelScope image ✔
|
||||
OpenBMB/VoxCPM-0.5B OpenBMB tts ✔
|
||||
OpenBMB/VoxCPM1.5 OpenBMB tts ✔
|
||||
ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI asr ✔
|
||||
FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM asr ✔
|
||||
ZhipuAI/GLM-OCR ZhipuAI ocr ✔
|
||||
```
|
||||
|
||||
## 文本生成
|
||||
|
||||
| 模型 | 参数量 | 模型id | 开源协议 |
|
||||
|
||||
@@ -243,35 +243,6 @@ struct ErrorResponse {
|
||||
error: String,
|
||||
}
|
||||
|
||||
// /// Get the owner/organization name for a model
|
||||
// fn which_model_to_owner(which_model: WhichModel) -> &'static str {
|
||||
// match which_model {
|
||||
// WhichModel::MiniCPM4_0_5B => "OpenBMB",
|
||||
// WhichModel::Qwen2_5VL3B | WhichModel::Qwen2_5VL7B => "Qwen",
|
||||
// WhichModel::Qwen3_0_6B | WhichModel::Qwen3ASR0_6B | WhichModel::Qwen3ASR1_7B => "Qwen",
|
||||
// WhichModel::Qwen3VL2B
|
||||
// | WhichModel::Qwen3VL4B
|
||||
// | WhichModel::Qwen3VL8B
|
||||
// | WhichModel::Qwen3VL32B
|
||||
// | WhichModel::Qwen3_5Gguf => "Qwen",
|
||||
// WhichModel::Qwen3_5_0_8B
|
||||
// | WhichModel::Qwen3_5_2B
|
||||
// | WhichModel::Qwen3_5_4B
|
||||
// | WhichModel::Qwen3_5_9B => "Qwen",
|
||||
// WhichModel::DeepSeekOCR | WhichModel::DeepSeekOCR2 => "deepseek-ai",
|
||||
// WhichModel::HunyuanOCR => "Tencent-Hunyuan",
|
||||
// WhichModel::PaddleOCRVL | WhichModel::PaddleOCRVL1_5 => "PaddlePaddle",
|
||||
// WhichModel::RMBG2_0 => "AI-ModelScope",
|
||||
// WhichModel::VoxCPM | WhichModel::VoxCPM1_5 => "OpenBMB",
|
||||
// WhichModel::GlmASRNano2512 | WhichModel::GlmOCR => "ZhipuAI",
|
||||
// WhichModel::FunASRNano2512 => "FunAudioLLM",
|
||||
// WhichModel::LFM2_1_2B
|
||||
// | WhichModel::LFM2_5_1_2BInstruct
|
||||
// | WhichModel::LFM2_5VL1_6B
|
||||
// | WhichModel::LFM2VL1_6B => "LiquidAI",
|
||||
// }
|
||||
// }
|
||||
|
||||
#[get("/models")]
|
||||
pub(crate) async fn models() -> (Status, (ContentType, Json<serde_json::Value>)) {
|
||||
if let Some(model_ref) = MODEL.get() {
|
||||
|
||||
Reference in New Issue
Block a user