跳到主要内容

推荐验证模型

离线模式选择器中的 Verified models(推荐验证模型) 列表经过严格筛选:均经过 Ante 智能体闭环测试,可直接从 Hugging Face 下载,并预先获知内存/显存需求。每个模型具有以下两种状态之一:

  • Evaled(已评测) — 运行了完整的公开基准评测:与云端前沿模型结果完全相同的 Terminal-Bench 2.1 Harness、固定构建与公开 Harbor 审计记录。实时得分展示于 antigma.ai/eval
  • Verified(已验证) — 经过端到端兼容性测试:模型能够顺利加载、对话模板解析正确,且在 Ante 智能体闭环中支持稳定的工具调用。尚未完成全部评测。

随着基准评测运行完成,模型会从 Verified 逐步升级为 Evaled。

当前推荐模型列表

模型量化格式下载大小最大上下文评测状态
Qwen3.8 27BQ4_K_M17 GB256KVerified
MiniMax-M2.7Q3_K_XL102 GB192KVerified
Qwen3.5 122B-A10BQ2_K45 GB256KVerified
Qwen3.6 35B-A3BQ4_K_M22 GB256KVerified
Qwen3.6 27BQ4_K_M17 GB256KEvaledTerminal-Bench 2.1 准确率 56.2%
GLM-4.7-FlashQ4_K_M18 GB198KVerified
Gemma 4 26B-A4B-itQ4_K_M16 GB256KVerified
Devstral-Small-2 24BQ4_K_M14 GB384KVerified
Qwen3.5 9BQ4_K_M5.7 GB256KVerified
Gemma 4 E4B-itQ4_K_M4.7 GB128KVerified

“最大上下文”为模型底层架构支持的上限;Ante 默认将初始上下文窗口设置为 32K 以保持内存占用可预测,您可以在偏好设置中针对各模型调大,或通过 ANTE_OFFLINE_CONTEXT 环境变量覆盖。

迄今为止的一项完整评测:Qwen3.6 27B 在 89 个 Terminal-Bench 2.1 任务(共 445 次 Trial)中取得了 56.2% 的准确率 —— 单个 17 GB 的本地模型在我们用于前沿模型的同一基准测试上展现出扎实实力。

自定义添加验证模型

Ante 在启动时会自动将 ~/.ante/verified_models.json 合并到内置推荐列表中。filename 匹配内置条目的条目将覆盖内置预设;新文件名会自动追加。

{
"models": [
{
"name": "My Custom Model",
"repo": "username/repo-name",
"filename": "model-Q4_K_M.gguf",
"context_window": 32768,
"file_size_mb": 5000,
"kv_cache_bytes_per_token": 131072,
"support_vision": false
}
}
}
字段说明
name在模型选择器中展示的名称
repo文件下载来源的 Hugging Face 仓库
filename仓库内的 GGUF 文件名(同时也是合并匹配的 Key)
context_window模型支持的最大上下文(Token 数)
file_size_mb下载大小,用于内存估算
kv_cache_bytes_per_token每个上下文 Token 的 KV 缓存增长量,用于内存估算
support_vision模型是否支持图片输入(可选)