跳到主要内容

智能体原生推理(实验性)

目前,离线模式通过管理外部 llama.cpp 服务端实现:Ante 安装、启动、监控并在退出时关闭它。这能够良好工作,并且是目前官方支持的本地推理方式。而下一步演进方向,则是将推理引擎直接运行在智能体进程内部(In-Process)

注意

本页面描述的是技术演进方向,而非现已正式发布的特性。此处提及的内容尚未包含在任何已发布的 Ante 构建版本中。

为什么需要进程内原生推理

外部推理服务单次只能接收一个独立的 HTTP 请求。而嵌入在智能体运行时内部的推理引擎能够感知整个 Agent 闭环,从而释放通用服务无法实现的深度优化:

  • 跨闭环前缀缓存复用(Prefix reuse across the loop) — 智能体轮次共享漫长而稳定的前缀:系统提示词、工具定义、历史对话记录。感知 Turn 生命周期的内置引擎可以直接在显存中保留这些前缀,无需每次请求重复计算。
  • 针对工具调用的约束解码(Constrained decoding for tool calls) — 工具调用参数必须能够按已知 Schema 解析。在特定语法规则下进行约束采样解码,可以直接在生成层面杜绝格式错误,避免事后重试。
  • 子智能体批量并发推理(Subagent batching) — 多个调用相同模型的并发子智能体可以通过同一个内置引擎进行 Batching 批处理,无需在单服务器端口上排队等待。

我们为之努力的目标:让本地模型成为智能体工作的首选底座,凭借其实际表现与能力脱颖而出,而非仅仅因成本和隐私妥协而容忍。与所有其他特性一样,这一宣称也将附带公开可检验的数据

探索原型:nanochat-rs

nanochat-rs 是我们公开发布的实验性底层原型:基于纯 Rust 实现的轻量 GPT 架构推理核心,基于 candle 构建,支持 Hugging Face 模型并保持极简代码面。它在设计上被定位为一个概念验证的玩具实现(toy by design) —— 它是 karpathy/nanochat 的 Rust 重写版,侧重于代码清晰度而非极致性能 —— 但它展示了未来架构的形态:原生推理与调用它的业务代码运行在同一个进程中,零外部服务二进制。

git clone https://github.com/AntigmaLabs/nanochat-rs
cd nanochat-rs
cargo run --release --features metal -- -p "write 100 words"

当前状态

目前运行本地模型的官方支持方式仍然是使用离线模式的托管 llama.cpp 引擎,或接入自建推理服务。进程内原生引擎的研发进展将公布在更新日志Discord 中。