跳到主要内容

自定义推理引擎

离线模式支持开箱即用,由 Ante 自动安装并监管引擎。该体系的每一层都可以被自由替换:二进制文件、启动参数或服务本身。

使用自编译的 llama.cpp 构建

Ante 解析引擎二进制的优先级如下:

  1. 位于 ~/.ante/llama.cpp/current 的托管版本
  2. offline-config.json 中锁定的二进制路径(见下文)
  3. 系统环境变量 PATH 中的 llama-server

如果您已经安装了 llama.cpp(如通过 brew install llama.cpp)并跳过了托管安装,Ante 会直接从 PATH 中识别。若想显式指定二进制路径,可在 ~/.ante/offline-config.json 中配置 llama_cpp.binaries

{
"llama_cpp": {
"binaries": {
"server": "/opt/llama.cpp/build/bin/llama-server",
"cli": "/opt/llama.cpp/build/bin/llama-cli"
}
}
}

两个文件必须真实存在才能生效。服务端二进制必须兼容标准 llama-server 参数:Ante 会携带自身参数启动它(--host 127.0.0.1 --port <port> -c <context> --jinja -ngl <gpu-layers>,加上每模型的 --temp--mmproj 等参数)。

备注

Ante 通常会在安装期间自行写入这些字段。若将其指向自定义构建版本,版本检查可能会提示“升级”回固定版本 —— 拒绝提示即可保留自定义构建。

调优服务启动命令

可以通过以下两处旋钮定制启动参数:

模型专属额外参数。 在模型的偏好设置中设置 extra_args,追加任意 llama-server 参数。字符串采用 Shell 语法解析并追加在 Ante 默认参数之后,冲突时以您的值为准:

{
"model_preferences": {
"Qwen3.6-27B-Q4_K_M.gguf": {
"model_id": "Qwen3.6-27B-Q4_K_M.gguf",
"extra_args": "--threads 12 --no-mmap --cache-type-k q8_0"
}
}
}

GPU 卸载层数。 llama_cpp.server_defaults.gpu_layers 控制 -ngl 参数。默认 -1 代表将所有网络层卸载至 GPU;若显存紧张可适当调小数值:

{
"llama_cpp": {
"server_defaults": { "gpu_layers": 24 }
}
}

连接到运行中的服务端

您可以完全独立运行 llama-server —— 任意构建版本、任意参数 —— 并让 Ante 作为客户端连接。Ante 会自动扫描本地端口 8080-8179,也支持在 /offline-mode 中按 Ctrl+A 手动输入 host:port 接入。

关于端点输入格式、Docker 示例、断开行为及远程主机数据流注意事项,请参见接入现有服务

使用其他完全不同的推理框架

任何提供兼容 OpenAI 接口的端点(Ollama、vLLM、LM Studio、局域网 GPU 服务器等),均可通过标准目录提供商机制接入 Ante。该方式提供常规提供商机制(模型选择器、通信协议);本页中的生命周期管理、内存预估与加载进度展示专属于托管的 llama.cpp 路径。参见添加本地提供商