From 899b1e7dfa8addc424aa10f5d9318af3bf36b705 Mon Sep 17 00:00:00 2001 From: jhqxxx <18280426169@163.com> Date: Tue, 31 Mar 2026 18:59:57 +0800 Subject: [PATCH] update doc --- README.md | 94 ++++++++++++++++++---------------- README.zh-CN.md | 94 +++++++++++++++++----------------- docs/installation.md | 69 ++++++++++++------------- docs/installation.zh-CN.md | 54 +++++++++++-------- docs/supported-models.md | 37 +++++++++++++ docs/supported-models.zh-CN.md | 37 +++++++++++++ src/api/mod.rs | 29 ----------- 7 files changed, 236 insertions(+), 178 deletions(-) diff --git a/README.md b/README.md index c8e7ce7..9ea5982 100644 --- a/README.md +++ b/README.md @@ -24,36 +24,26 @@ aha is a high-performance, cross-platform AI inference engine built with Rust and the Candle framework. It brings state-of-the-art AI models to your local machine—no API keys, no cloud dependencies, just pure, fast AI running directly on your hardware. -## Changelog -### 2026-03-31 -- aha model name use modelscope id replace -- update WhichModel -- Usage add time info -- dependencies delete aha_openai_dive,chrono -### v0.2.5 (2026-03-30) -- add LFM2.5VL-1.6B -- add LFM2VL-1.6B +### Supported Models -### v0.2.4 (2026-03-23) -- add LFM2.5-1.2B-Instruct -- add LFM2-1.2B +| Category | Models | +|----------|--------| +| **Text** | Qwen3, MiniCPM4,
LFM2, LFM2.5 | +| **Vision** | Qwen2.5-VL, Qwen3-VL, Qwen3.5,
LFM2.5-VL, LFM2-VL | +| **OCR** | DeepSeek-OCR, DeepSeek-OCR-2 ,
PaddleOCR-VL, PaddleOCR-VL1.5,
Hunyuan-OCR, GLM-OCR | +| **ASR** | GLM-ASR-Nano, Fun-ASR-Nano, Qwen3-ASR | +| **Audio** | VoxCPM, VoxCPM1.5 | +| **Image** | RMBG-2.0 (background removal) | -### v0.2.3 (2026-03-18) -- add DeepSeek-OCR-2 - -### 2026-03-17 -- add PaddleOCR-VL1.5 model -- fix qwen3.5 position_ids create bug -- cli param add - - gguf_path: Local GGUF model weight path (required for loading models with GGUF) - - mmproj_path: Local path to mmproj GGUF weights (required for multimodal GGUF loading) -- WhichModel add qwen3.5-gguf - -### 2026-03-16 -- Added Qwen3.5 mmproj - -**[View full changelog](docs/changelog.md)** → +## Why aha? +- **🚀 High-Performance Inference** - Powered by Candle framework for efficient tensor computation and model inference +- **🔧 Unified Interface** — One tool for text, vision, speech, and OCR +- **📦 Local-First** — All processing runs locally, no data leaves your machine +- **🎯 Cross-Platform** — Works on Linux, macOS, and Windows +- **⚡ GPU Accelerated** — Optional CUDA support for faster inference +- **🛡️ Memory Safe** — Built with Rust for reliability +- **🧠 Attention Optimization** - Optional Flash Attention support for optimized long sequence processing ## Quick Start @@ -111,7 +101,7 @@ aha serv -m Qwen/Qwen3-0.6B -p 10100 Then use the unified (OpenAI-compatible) API: ```bash -curl http://localhost:10100/chat/completions \ +curl http://localhost:10100/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Qwen/Qwen3-0.6B", @@ -121,16 +111,38 @@ curl http://localhost:10100/chat/completions \ ' ``` -### Supported Models +## Changelog + +### 2026-03-31 +- aha model name use modelscope id replace +- update WhichModel +- Usage add time info +- dependencies delete aha_openai_dive,chrono + +### v0.2.5 (2026-03-30) +- add LFM2.5VL-1.6B +- add LFM2VL-1.6B + +### v0.2.4 (2026-03-23) +- add LFM2.5-1.2B-Instruct +- add LFM2-1.2B + +### v0.2.3 (2026-03-18) +- add DeepSeek-OCR-2 + +### 2026-03-17 +- add PaddleOCR-VL1.5 model +- fix qwen3.5 position_ids create bug +- cli param add + - gguf_path: Local GGUF model weight path (required for loading models with GGUF) + - mmproj_path: Local path to mmproj GGUF weights (required for multimodal GGUF loading) +- WhichModel add qwen3.5-gguf + +### 2026-03-16 +- Added Qwen3.5 mmproj + +**[View full changelog](docs/changelog.md)** → -| Category | Models | -|----------|--------| -| **Text** | Qwen3, MiniCPM4,
LFM2, LFM2.5 | -| **Vision** | Qwen2.5-VL, Qwen3-VL, Qwen3.5,
LFM2.5-VL, LFM2-VL | -| **OCR** | DeepSeek-OCR, DeepSeek-OCR-2 ,
PaddleOCR-VL, PaddleOCR-VL1.5,
Hunyuan-OCR, GLM-OCR | -| **ASR** | GLM-ASR-Nano, Fun-ASR-Nano, Qwen3-ASR | -| **Audio** | VoxCPM, VoxCPM1.5 | -| **Image** | RMBG-2.0 (background removal) | ## Documentation @@ -145,14 +157,6 @@ curl http://localhost:10100/chat/completions \ | [Development](docs/development.md) | Contributing guide | | [Changelog](docs/changelog.md) | Version history | -## Why aha? -- **🚀 High-Performance Inference** - Powered by Candle framework for efficient tensor computation and model inference -- **🔧 Unified Interface** — One tool for text, vision, speech, and OCR -- **📦 Local-First** — All processing runs locally, no data leaves your machine -- **🎯 Cross-Platform** — Works on Linux, macOS, and Windows -- **⚡ GPU Accelerated** — Optional CUDA support for faster inference -- **🛡️ Memory Safe** — Built with Rust for reliability -- **🧠 Attention Optimization** - Optional Flash Attention support for optimized long sequence processing ## Development diff --git a/README.zh-CN.md b/README.zh-CN.md index 12c0501..0f7a2d0 100644 --- a/README.zh-CN.md +++ b/README.zh-CN.md @@ -24,37 +24,25 @@ aha 是一款基于 Rust 和 Candle 框架构建的高性能跨平台 AI 推理引擎。将最先进的 AI 模型带到您的本地机器——无需 API 密钥,无需云依赖,纯粹、快速的 AI,直接在您的硬件上运行。 -## 更新日志 +### 支持的模型 -### 2026-03-31 -- aha模型名称使用 modelscope id 替换 -- 更新 WhichModel 枚举 -- Usage 增加时间信息 -- 删除 aha_openai_dive, chrono 依赖 +| 类别 | 模型 | +|------|------| +| **文本** | Qwen3, MiniCPM4,
LFM2, LFM2.5 | +| **视觉** | Qwen2.5-VL, Qwen3-VL, Qwen3.5
LFM2.5-VL, LFM2-VL | +| **OCR** | DeepSeek-OCR, DeepSeek-OCR-2 ,
PaddleOCR-VL, PaddleOCR-VL1.5,
Hunyuan-OCR, GLM-OCR | +| **ASR** | GLM-ASR-Nano, Fun-ASR-Nano, Qwen3-ASR | +| **音频** | VoxCPM, VoxCPM1.5 | +| **图像** | RMBG-2.0 (背景移除) | -### v0.2.5 (2026-03-30) -- 新增 LFM2.5VL-1.6B -- 新增 LFM2VL-1.6B - -### v0.2.4 (2026-03-23) -- 新增 LFM2.5-1.2B-Instruct -- 新增 LFM2-1.2B - -### v0.2.3 (2026-03-18) -- 新增 DeepSeek-OCR-2 - -### 2026-03-17 -- 新增 PaddleOCR-VL1.5 模型 -- 修复 qwen3.5 position_ids 创建错误 -- cli 参数增加 - - gguf_path: 本地 GGUF 模型权重路径(加载 GGUF 模型时需要) - - mmproj_path: 本地 mmproj GGUF 权重路径(加载多模态 GGUF 时需要) -- WhichModel 增加 qwen3.5-gguf - -### 2026-03-16 -- 增加 Qwen3.5 mmproj - -**[查看完整更新日志](docs/changelog.zh-CN.md)** → +## 为什么选择 aha? +- **🚀 高性能推理** - 基于 Candle 框架,提供高效的张量计算和模型推理 +- **🔧 统一接口** — 一个工具搞定文本、视觉、语音和 OCR +- **📦 本地优先** — 所有处理在本地运行,数据不离境 +- **🎯 跨平台** — 支持 Linux、macOS 和 Windows +- **⚡ GPU 加速** — 可选 CUDA 支持以获得更快推理 +- **🛡️ 内存安全** — Rust 构建,稳定可靠 +- **🧠 注意力优化** - 可选 Flash Attention 支持,优化长序列处理 ## 快速开始 @@ -112,7 +100,7 @@ aha serv -m Qwen/Qwen3-0.6B -p 10100 然后使用统一(兼容 OpenAI)的 API: ```bash -curl http://localhost:10100/chat/completions \ +curl http://localhost:10100/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Qwen/Qwen3-0.6B", @@ -121,18 +109,37 @@ curl http://localhost:10100/chat/completions \ }' ``` +## 更新日志 -### 支持的模型 +### 2026-03-31 +- aha模型名称使用 modelscope id 替换 +- 更新 WhichModel 枚举 +- Usage 增加时间信息 +- 删除 aha_openai_dive, chrono 依赖 -| 类别 | 模型 | -|------|------| -| **文本** | Qwen3, MiniCPM4,
LFM2, LFM2.5 | -| **视觉** | Qwen2.5-VL, Qwen3-VL, Qwen3.5
LFM2.5-VL, LFM2-VL | -| **OCR** | DeepSeek-OCR, DeepSeek-OCR-2 ,
PaddleOCR-VL, PaddleOCR-VL1.5,
Hunyuan-OCR, GLM-OCR | -| **ASR** | GLM-ASR-Nano, Fun-ASR-Nano,Qwen3-ASR | -| **音频** | VoxCPM, VoxCPM1.5 | -| **图像** | RMBG-2.0 (背景移除) | +### v0.2.5 (2026-03-30) +- 新增 LFM2.5VL-1.6B +- 新增 LFM2VL-1.6B +### v0.2.4 (2026-03-23) +- 新增 LFM2.5-1.2B-Instruct +- 新增 LFM2-1.2B + +### v0.2.3 (2026-03-18) +- 新增 DeepSeek-OCR-2 + +### 2026-03-17 +- 新增 PaddleOCR-VL1.5 模型 +- 修复 qwen3.5 position_ids 创建错误 +- cli 参数增加 + - gguf_path: 本地 GGUF 模型权重路径(加载 GGUF 模型时需要) + - mmproj_path: 本地 mmproj GGUF 权重路径(加载多模态 GGUF 时需要) +- WhichModel 增加 qwen3.5-gguf + +### 2026-03-16 +- 增加 Qwen3.5 mmproj + +**[查看完整更新日志](docs/changelog.zh-CN.md)** → ## 文档 @@ -147,15 +154,6 @@ curl http://localhost:10100/chat/completions \ | [开发指南](docs/development.zh-CN.md) | 贡献指南 | | [更新日志](docs/changelog.zh-CN.md) | 版本历史 | -## 为什么选择 aha? -- **🚀 高性能推理** - 基于 Candle 框架,提供高效的张量计算和模型推理 -- **🔧 统一接口** — 一个工具搞定文本、视觉、语音和 OCR -- **📦 本地优先** — 所有处理在本地运行,数据不离境 -- **🎯 跨平台** — 支持 Linux、macOS 和 Windows -- **⚡ GPU 加速** — 可选 CUDA 支持以获得更快推理 -- **🛡️ 内存安全** — Rust 构建,稳定可靠 -- **🧠 注意力优化** - 可选 Flash Attention 支持,优化长序列处理 - ## 开发 ### aha 作为库使用 diff --git a/docs/installation.md b/docs/installation.md index 9f712ea..3c3bca9 100644 --- a/docs/installation.md +++ b/docs/installation.md @@ -277,43 +277,42 @@ aha list Expected output for `aha list`: -``` +```shell #Supported models: - - Available models: +Available models: -Model Name ModelScope ID ------------------------------------------------------------ -LiquidAI/LFM2-1.2B LiquidAI/LFM2-1.2B ✔ -LiquidAI/LFM2.5-1.2B-Instruct LiquidAI/LFM2.5-1.2B-Instruct ✔ -LiquidAI/LFM2.5-VL-1.6B LiquidAI/LFM2.5-VL-1.6B ✔ -LiquidAI/LFM2-VL-1.6B LiquidAI/LFM2-VL-1.6B ✔ -OpenBMB/MiniCPM4-0.5B OpenBMB/MiniCPM4-0.5B ✔ -Qwen/Qwen2.5-VL-3B-Instruct Qwen/Qwen2.5-VL-3B-Instruct ✔ -Qwen/Qwen2.5-VL-7B-Instruct Qwen/Qwen2.5-VL-7B-Instruct -Qwen/Qwen3-0.6B Qwen/Qwen3-0.6B ✔ -Qwen/Qwen3.5-0.8B Qwen/Qwen3.5-0.8B ✔ -Qwen/Qwen3.5-2B Qwen/Qwen3.5-2B -Qwen/Qwen3.5-4B Qwen/Qwen3.5-4B -Qwen/Qwen3.5-9B Qwen/Qwen3.5-9B -qwen3.5-gguf qwen3.5-gguf -Qwen/Qwen3-ASR-0.6B Qwen/Qwen3-ASR-0.6B ✔ -Qwen/Qwen3-ASR-1.7B Qwen/Qwen3-ASR-1.7B -Qwen/Qwen3-VL-2B-Instruct Qwen/Qwen3-VL-2B-Instruct ✔ -Qwen/Qwen3-VL-4B-Instruct Qwen/Qwen3-VL-4B-Instruct -Qwen/Qwen3-VL-8B-Instruct Qwen/Qwen3-VL-8B-Instruct -Qwen/Qwen3-VL-32B-Instruct Qwen/Qwen3-VL-32B-Instruct -deepseek-ai/DeepSeek-OCR deepseek-ai/DeepSeek-OCR ✔ -deepseek-ai/DeepSeek-OCR-2 deepseek-ai/DeepSeek-OCR-2 -Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan/HunyuanOCR ✔ -PaddlePaddle/PaddleOCR-VL PaddlePaddle/PaddleOCR-VL ✔ -PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle/PaddleOCR-VL-1.5 -AI-ModelScope/RMBG-2.0 AI-ModelScope/RMBG-2.0 ✔ -OpenBMB/VoxCPM-0.5B OpenBMB/VoxCPM-0.5B ✔ -OpenBMB/VoxCPM1.5 OpenBMB/VoxCPM1.5 ✔ -ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI/GLM-ASR-Nano-2512 ✔ -FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM/Fun-ASR-Nano-2512 ✔ -ZhipuAI/GLM-OCR ZhipuAI/GLM-OCR +Model ID Owner type Download +-------------------------------------------------------------------------------- +LiquidAI/LFM2-1.2B LiquidAI llm ✔ +LiquidAI/LFM2.5-1.2B-Instruct LiquidAI llm ✔ +LiquidAI/LFM2.5-VL-1.6B LiquidAI vlm ✔ +LiquidAI/LFM2-VL-1.6B LiquidAI vlm ✔ +OpenBMB/MiniCPM4-0.5B OpenBMB llm ✔ +Qwen/Qwen2.5-VL-3B-Instruct Qwen vlm ✔ +Qwen/Qwen2.5-VL-7B-Instruct Qwen vlm +Qwen/Qwen3-0.6B Qwen llm ✔ +Qwen/Qwen3.5-0.8B Qwen vlm ✔ +Qwen/Qwen3.5-2B Qwen vlm +Qwen/Qwen3.5-4B Qwen vlm +Qwen/Qwen3.5-9B Qwen vlm +qwen3.5-gguf none vlm +Qwen/Qwen3-ASR-0.6B Qwen asr ✔ +Qwen/Qwen3-ASR-1.7B Qwen asr +Qwen/Qwen3-VL-2B-Instruct Qwen vlm ✔ +Qwen/Qwen3-VL-4B-Instruct Qwen vlm +Qwen/Qwen3-VL-8B-Instruct Qwen vlm +Qwen/Qwen3-VL-32B-Instruct Qwen vlm +deepseek-ai/DeepSeek-OCR deepseek-ai ocr ✔ +deepseek-ai/DeepSeek-OCR-2 deepseek-ai ocr +Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan ocr ✔ +PaddlePaddle/PaddleOCR-VL PaddlePaddle ocr ✔ +PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle ocr +AI-ModelScope/RMBG-2.0 AI-ModelScope image ✔ +OpenBMB/VoxCPM-0.5B OpenBMB tts ✔ +OpenBMB/VoxCPM1.5 OpenBMB tts ✔ +ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI asr ✔ +FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM asr ✔ +ZhipuAI/GLM-OCR ZhipuAI ocr ✔ ``` diff --git a/docs/installation.zh-CN.md b/docs/installation.zh-CN.md index f309c0b..e7f0aea 100644 --- a/docs/installation.zh-CN.md +++ b/docs/installation.zh-CN.md @@ -279,28 +279,40 @@ aha list ```shell #Supported models: - Available models: +Available models: -Model Name ModelScope ID ------------------------------------------------------------ -OpenBMB/MiniCPM4-0.5B OpenBMB/MiniCPM4-0.5B -Qwen/Qwen2.5-VL-3B-Instruct Qwen/Qwen2.5-VL-3B-Instruct -Qwen/Qwen2.5-VL-7B-Instruct Qwen/Qwen2.5-VL-7B-Instruct -Qwen/Qwen3-0.6B Qwen/Qwen3-0.6B -Qwen/Qwen3-ASR-0.6B Qwen/Qwen3-ASR-0.6B -Qwen/Qwen3-ASR-1.7B Qwen/Qwen3-ASR-1.7B -Qwen/Qwen3-VL-4B-Instruct Qwen/Qwen3-VL-2B-Instruct -Qwen/Qwen3-VL-4B-Instruct Qwen/Qwen3-VL-4B-Instruct -Qwen/Qwen3-VL-8B-Instruct Qwen/Qwen3-VL-8B-Instruct -Qwen/Qwen3-VL-32B-Instruct Qwen/Qwen3-VL-32B-Instruct -deepseek-ai/DeepSeek-OCR deepseek-ai/DeepSeek-OCR -Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan/HunyuanOCR -PaddlePaddle/PaddleOCR-VL PaddlePaddle/PaddleOCR-VL -AI-ModelScope/RMBG-2.0 AI-ModelScope/RMBG-2.0 -voxcpm OpenBMB/VoxCPM-0.5B -OpenBMB/VoxCPM1.5 OpenBMB/VoxCPM1.5 -ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI/GLM-ASR-Nano-2512 -FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM/Fun-ASR-Nano-2512 +Model ID Owner type Download +-------------------------------------------------------------------------------- +LiquidAI/LFM2-1.2B LiquidAI llm ✔ +LiquidAI/LFM2.5-1.2B-Instruct LiquidAI llm ✔ +LiquidAI/LFM2.5-VL-1.6B LiquidAI vlm ✔ +LiquidAI/LFM2-VL-1.6B LiquidAI vlm ✔ +OpenBMB/MiniCPM4-0.5B OpenBMB llm ✔ +Qwen/Qwen2.5-VL-3B-Instruct Qwen vlm ✔ +Qwen/Qwen2.5-VL-7B-Instruct Qwen vlm +Qwen/Qwen3-0.6B Qwen llm ✔ +Qwen/Qwen3.5-0.8B Qwen vlm ✔ +Qwen/Qwen3.5-2B Qwen vlm +Qwen/Qwen3.5-4B Qwen vlm +Qwen/Qwen3.5-9B Qwen vlm +qwen3.5-gguf none vlm +Qwen/Qwen3-ASR-0.6B Qwen asr ✔ +Qwen/Qwen3-ASR-1.7B Qwen asr +Qwen/Qwen3-VL-2B-Instruct Qwen vlm ✔ +Qwen/Qwen3-VL-4B-Instruct Qwen vlm +Qwen/Qwen3-VL-8B-Instruct Qwen vlm +Qwen/Qwen3-VL-32B-Instruct Qwen vlm +deepseek-ai/DeepSeek-OCR deepseek-ai ocr ✔ +deepseek-ai/DeepSeek-OCR-2 deepseek-ai ocr +Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan ocr ✔ +PaddlePaddle/PaddleOCR-VL PaddlePaddle ocr ✔ +PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle ocr +AI-ModelScope/RMBG-2.0 AI-ModelScope image ✔ +OpenBMB/VoxCPM-0.5B OpenBMB tts ✔ +OpenBMB/VoxCPM1.5 OpenBMB tts ✔ +ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI asr ✔ +FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM asr ✔ +ZhipuAI/GLM-OCR ZhipuAI ocr ✔ ``` diff --git a/docs/supported-models.md b/docs/supported-models.md index 39d3b3f..0b4414b 100644 --- a/docs/supported-models.md +++ b/docs/supported-models.md @@ -2,6 +2,43 @@ aha supports a growing collection of state-of-the-art AI models across multiple domains. +```shell +Available models: + +Model ID Owner type Download +-------------------------------------------------------------------------------- +LiquidAI/LFM2-1.2B LiquidAI llm ✔ +LiquidAI/LFM2.5-1.2B-Instruct LiquidAI llm ✔ +LiquidAI/LFM2.5-VL-1.6B LiquidAI vlm ✔ +LiquidAI/LFM2-VL-1.6B LiquidAI vlm ✔ +OpenBMB/MiniCPM4-0.5B OpenBMB llm ✔ +Qwen/Qwen2.5-VL-3B-Instruct Qwen vlm ✔ +Qwen/Qwen2.5-VL-7B-Instruct Qwen vlm +Qwen/Qwen3-0.6B Qwen llm ✔ +Qwen/Qwen3.5-0.8B Qwen vlm ✔ +Qwen/Qwen3.5-2B Qwen vlm +Qwen/Qwen3.5-4B Qwen vlm +Qwen/Qwen3.5-9B Qwen vlm +qwen3.5-gguf none vlm +Qwen/Qwen3-ASR-0.6B Qwen asr ✔ +Qwen/Qwen3-ASR-1.7B Qwen asr +Qwen/Qwen3-VL-2B-Instruct Qwen vlm ✔ +Qwen/Qwen3-VL-4B-Instruct Qwen vlm +Qwen/Qwen3-VL-8B-Instruct Qwen vlm +Qwen/Qwen3-VL-32B-Instruct Qwen vlm +deepseek-ai/DeepSeek-OCR deepseek-ai ocr ✔ +deepseek-ai/DeepSeek-OCR-2 deepseek-ai ocr +Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan ocr ✔ +PaddlePaddle/PaddleOCR-VL PaddlePaddle ocr ✔ +PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle ocr +AI-ModelScope/RMBG-2.0 AI-ModelScope image ✔ +OpenBMB/VoxCPM-0.5B OpenBMB tts ✔ +OpenBMB/VoxCPM1.5 OpenBMB tts ✔ +ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI asr ✔ +FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM asr ✔ +ZhipuAI/GLM-OCR ZhipuAI ocr ✔ +``` + ## Language Model | Model | Parameters | Model Id | License | diff --git a/docs/supported-models.zh-CN.md b/docs/supported-models.zh-CN.md index d372fce..b451d02 100644 --- a/docs/supported-models.zh-CN.md +++ b/docs/supported-models.zh-CN.md @@ -2,6 +2,43 @@ aha 支持多个领域的最先进 AI 模型集合。 +```shell +Available models: + +Model ID Owner type Download +-------------------------------------------------------------------------------- +LiquidAI/LFM2-1.2B LiquidAI llm ✔ +LiquidAI/LFM2.5-1.2B-Instruct LiquidAI llm ✔ +LiquidAI/LFM2.5-VL-1.6B LiquidAI vlm ✔ +LiquidAI/LFM2-VL-1.6B LiquidAI vlm ✔ +OpenBMB/MiniCPM4-0.5B OpenBMB llm ✔ +Qwen/Qwen2.5-VL-3B-Instruct Qwen vlm ✔ +Qwen/Qwen2.5-VL-7B-Instruct Qwen vlm +Qwen/Qwen3-0.6B Qwen llm ✔ +Qwen/Qwen3.5-0.8B Qwen vlm ✔ +Qwen/Qwen3.5-2B Qwen vlm +Qwen/Qwen3.5-4B Qwen vlm +Qwen/Qwen3.5-9B Qwen vlm +qwen3.5-gguf none vlm +Qwen/Qwen3-ASR-0.6B Qwen asr ✔ +Qwen/Qwen3-ASR-1.7B Qwen asr +Qwen/Qwen3-VL-2B-Instruct Qwen vlm ✔ +Qwen/Qwen3-VL-4B-Instruct Qwen vlm +Qwen/Qwen3-VL-8B-Instruct Qwen vlm +Qwen/Qwen3-VL-32B-Instruct Qwen vlm +deepseek-ai/DeepSeek-OCR deepseek-ai ocr ✔ +deepseek-ai/DeepSeek-OCR-2 deepseek-ai ocr +Tencent-Hunyuan/HunyuanOCR Tencent-Hunyuan ocr ✔ +PaddlePaddle/PaddleOCR-VL PaddlePaddle ocr ✔ +PaddlePaddle/PaddleOCR-VL-1.5 PaddlePaddle ocr +AI-ModelScope/RMBG-2.0 AI-ModelScope image ✔ +OpenBMB/VoxCPM-0.5B OpenBMB tts ✔ +OpenBMB/VoxCPM1.5 OpenBMB tts ✔ +ZhipuAI/GLM-ASR-Nano-2512 ZhipuAI asr ✔ +FunAudioLLM/Fun-ASR-Nano-2512 FunAudioLLM asr ✔ +ZhipuAI/GLM-OCR ZhipuAI ocr ✔ +``` + ## 文本生成 | 模型 | 参数量 | 模型id | 开源协议 | diff --git a/src/api/mod.rs b/src/api/mod.rs index d57340f..904810a 100644 --- a/src/api/mod.rs +++ b/src/api/mod.rs @@ -243,35 +243,6 @@ struct ErrorResponse { error: String, } -// /// Get the owner/organization name for a model -// fn which_model_to_owner(which_model: WhichModel) -> &'static str { -// match which_model { -// WhichModel::MiniCPM4_0_5B => "OpenBMB", -// WhichModel::Qwen2_5VL3B | WhichModel::Qwen2_5VL7B => "Qwen", -// WhichModel::Qwen3_0_6B | WhichModel::Qwen3ASR0_6B | WhichModel::Qwen3ASR1_7B => "Qwen", -// WhichModel::Qwen3VL2B -// | WhichModel::Qwen3VL4B -// | WhichModel::Qwen3VL8B -// | WhichModel::Qwen3VL32B -// | WhichModel::Qwen3_5Gguf => "Qwen", -// WhichModel::Qwen3_5_0_8B -// | WhichModel::Qwen3_5_2B -// | WhichModel::Qwen3_5_4B -// | WhichModel::Qwen3_5_9B => "Qwen", -// WhichModel::DeepSeekOCR | WhichModel::DeepSeekOCR2 => "deepseek-ai", -// WhichModel::HunyuanOCR => "Tencent-Hunyuan", -// WhichModel::PaddleOCRVL | WhichModel::PaddleOCRVL1_5 => "PaddlePaddle", -// WhichModel::RMBG2_0 => "AI-ModelScope", -// WhichModel::VoxCPM | WhichModel::VoxCPM1_5 => "OpenBMB", -// WhichModel::GlmASRNano2512 | WhichModel::GlmOCR => "ZhipuAI", -// WhichModel::FunASRNano2512 => "FunAudioLLM", -// WhichModel::LFM2_1_2B -// | WhichModel::LFM2_5_1_2BInstruct -// | WhichModel::LFM2_5VL1_6B -// | WhichModel::LFM2VL1_6B => "LiquidAI", -// } -// } - #[get("/models")] pub(crate) async fn models() -> (Status, (ContentType, Json)) { if let Some(model_ref) = MODEL.get() {