推荐验证模型
在离线模式选择器中的 Verified models(推荐验证模型) 列表经过严格筛选:均经过 Ante 智能体闭环测试,可直接从 Hugging Face 下载,并预先获知内存/显存需求。每个模型具有以下两种状态之一:
- Evaled(已评测) — 运行了完整的公开基准评测:与云端前沿模型结果完全相同的 Terminal-Bench 2.1 Harness、固定构建与公开 Harbor 审计记录。实时得分展示于 antigma.ai/eval。
- Verified(已验证) — 经过端到端兼容性测试:模型能够顺利加载、对话模板解析正确,且在 Ante 智能体闭环中支持稳定的工具调用。尚未完成全部评测。
随着基准评测运行完成,模型会从 Verified 逐步升级为 Evaled。
当前推荐模型列表
| 模型 | 量化格式 | 下载大小 | 最大上下文 | 评测状态 |
|---|---|---|---|---|
| Qwen3.8 27B | Q4_K_M | 17 GB | 256K | Verified |
| MiniMax-M2.7 | Q3_K_XL | 102 GB | 192K | Verified |
| Qwen3.5 122B-A10B | Q2_K | 45 GB | 256K | Verified |
| Qwen3.6 35B-A3B | Q4_K_M | 22 GB | 256K | Verified |
| Qwen3.6 27B | Q4_K_M | 17 GB | 256K | Evaled — Terminal-Bench 2.1 准确率 56.2% |
| GLM-4.7-Flash | Q4_K_M | 18 GB | 198K | Verified |
| Gemma 4 26B-A4B-it | Q4_K_M | 16 GB | 256K | Verified |
| Devstral-Small-2 24B | Q4_K_M | 14 GB | 384K | Verified |
| Qwen3.5 9B | Q4_K_M | 5.7 GB | 256K | Verified |
| Gemma 4 E4B-it | Q4_K_M | 4.7 GB | 128K | Verified |
“最大上下文”为模型底层架构支持的上限;Ante 默认将初始上下文窗口设置为 32K 以保持内存占用可预测,您可以在偏好设置中针对各模型调大,或通过 ANTE_OFFLINE_CONTEXT 环境变量覆盖。
迄今为止的一项完整评测:Qwen3.6 27B 在 89 个 Terminal-Bench 2.1 任务(共 445 次 Trial)中取得了 56.2% 的准确率 —— 单个 17 GB 的本地模型在我们用于前沿模型的同一基准测试上展现出扎实实力。
自定义添加验证模型
Ante 在启动时会自动将 ~/.ante/verified_models.json 合并到内置推荐列表中。filename 匹配内置条目的条目将覆盖内置预设;新文件名会自动追加。
{
"models": [
{
"name": "My Custom Model",
"repo": "username/repo-name",
"filename": "model-Q4_K_M.gguf",
"context_window": 32768,
"file_size_mb": 5000,
"kv_cache_bytes_per_token": 131072,
"support_vision": false
}
}
}
| 字段 | 说明 |
|---|---|
name | 在模型选择器中展示的名称 |
repo | 文件下载来源的 Hugging Face 仓库 |
filename | 仓库内的 GGUF 文件名(同时也是合并匹配的 Key) |
context_window | 模型支持的最大上下文(Token 数) |
file_size_mb | 下载大小,用于内存估算 |
kv_cache_bytes_per_token | 每个上下文 Token 的 KV 缓存增长量,用于内存估算 |
support_vision | 模型是否支持图片输入(可选) |