跳到主要内容

独立自包含设计

Ante 是一个独立的单二进制程序(压缩下载仅 ~15MB),能够自主管理其内置的推理引擎。只需准备一个 GGUF 文件,即可在自有硬件上拥有完整的编码智能体:无需 API 密钥、无需注册账号,模型调用绝不离开本地机器。

隐私边界

本地推理确保模型请求与响应完全留在本地硬件内。Ante 应用程序本身的遥测数据与模型通信相互独立;对于完全禁止导出任何 OpenTelemetry 指标或日志的运行,可设置 ANTE_TELEMETRY=off。这不会禁用本地日志文件。参见遥测机制

本地运行是 Ante 的一等公民体验。托管云端提供商与本地模型存在于同一个目录系统,运行完全一致的完整提示词与工具链,并经受相同的公开基准评测。您可以按会话为任务选择最适合的运行模式。

选择部署拓扑

拓扑架构架构形态适用场景
全前沿云端仅使用云端托管提供商追求顶尖智能上限,具备良好网络连接与预算
混合模式本地模型与云端模型并存,在会话间或对话中随时切换部分工作涉及隐私敏感或高频调用,部分任务需要前沿模型
完全本地内置推理引擎承载所有调用离网隔离机器、严苛的数据隐私合规、零边际成本

Ante 对本地模型的支持体系

平等视作标准提供商。 任何提供兼容 OpenAI 接口的本地服务端(Ollama、vLLM、LM Studio、自建服务等),均通过与托管提供商相同的 catalog.json 机制接入。无需特殊定制逻辑,后续也无需迁移。参见添加本地提供商目录参考手册

原生深度集成。 Ante 不仅支持配置一个基础 URL。离线模式能自动管理 llama.cpp 运行时:匹配硬件架构的固定校验构建版本(Apple Silicon Metal;Linux CUDA、Vulkan 或 CPU)、全盘 GGUF 文件自动发现、加载前内存显存智能预估、实时加载进度展示,以及在 TUI 中直接控制服务端生命周期。推荐验证模型列表让您在下载 17 GB 权重前明确其运行表现。若希望使用自定义构建或启动参数,请参见自定义引擎

智能体原生推理研发中。 我们的终极目标是将推理引擎直接嵌入智能体进程,针对智能体调用大模型的行为特征深度调优:跨轮次前缀缓存复用、工具调用的约束解码、子智能体间的批量并发推理。我们通过开源项目 nanochat-rs(一个纯 Rust 实现的精简推理核心)公开推进探索。参见智能体原生推理

灵活混合本地与前沿模型

当离线模式加载模型后,Ante 会将其注册为 local 提供商:与 Anthropic 或 OpenAI 并列的标准 OpenAI 兼容目录项。在此基础上,切换体验顺畅自然:

  • 会话中随时切换。 在 TUI 中输入 /providers 无需重启即可切换提供商与模型。在开发常规代码时使用前沿模型,在处理敏感仓库时切换至本地模型,随后随时切回。
  • 命令行按需指定。 ante --offline-model <file> 针对本地模型执行脚本或无头任务,其他会话继续使用托管提供商。
  • 多客户端共享同一本地模型。 ante serve --offline-model <path> 加载一次即可供所有接入客户端复用,且任何会话均可直接连接到已运行的 llama 服务(自动扫描 8080-8179 端口)。
  • 为子智能体分配轻量模型。 Sub-agent 子智能体可通过 Frontmatter 中的 model: 单独指定模型 ID,使探索或搜索智能体运行在比主循环更小、更快的模型上。

需要了解的一项边界:一个会话一次与一个提供商通信。切换是即时的,但子智能体会运行在其父会话的提供商上,因此目前尚不支持在同一个会话中将主循环路由至前沿提供商而将子智能体路由至 local

真实可验证的基准数据

我们以评测前沿模型相同的严谨标准评测本地模型:相同的测试环境、固定公开版本、可审计的 Harbor 运行记录。Qwen3.6 27B(17 GB 下载)在 Terminal-Bench 2.1 跨 445 次 Trial 评测中取得 56.2% 的准确率 —— 实时数据见 antigma.ai/eval,完整精选列表见推荐验证模型