上下文窗口就是你的预算,token 就是钱。TrueFoundry 8 月开源的 TrueForge(MIT 协议、GitHub 开放)把这句话做到了极致:官方实测,用开源 GLM-5.2 驱动,在 DevRev 企业基准的 14 项任务里完成 11 项,总花费 2.9 美元,比 Claude 托管代理框架完成同样任务(11.8 美元)低 75%。
🔩 本教程适合:被 Agent 账单吓到的开发者/团队。你不需要换模型、不需要迁移现有栈,TrueForge 是「厂商中立」的——想用哪家模型都行。
先搞懂:TrueForge 的钱省在哪?
一句话理解:它把「省 token」从口号变成了工程机制。成本优化核心围绕上下文工程设计,官方公开了四招:
| 机制 | 做法 | 省了什么 |
|---|---|---|
| 延迟加载工具 schema | MCP 工具定义不预先全量注入,用时才加载 | 省掉每轮对话携带的巨型 schema |
| 子代理独立任务 | 大任务拆给子代理,各自持有独立上下文 | 避免主线程上下文被撑爆 |
| 大结果转文件 | 工具返回的大体积结果写文件,只留引用进上下文 | 不把几千行日志塞进活跃窗口 |
| 长对话自动压缩 | 默认 5 万 token 阈值,超限自动摘要压缩 | 长任务不再线性烧钱 |
别混淆:这是「执行框架」的降本,不是模型价格降本。模型路由降本可参考《DeepSeek 峰谷定价》,两者可以叠加用。
Step 1:本地一条命令启动
1 本地开发:SQLite 即开即用
TrueForge 支持本地单命令 + SQLite 启动,适合开发与试用:
# 拉仓库并按 README 安装
git clone https://github.com/truefoundry/trueforge
cd trueforge && pip install -e .
# 单命令启动(默认 SQLite 存储)
trueforge start --local
# 打开控制台 http://localhost:8080,创建第一个 Agent
⚠️ 官方明确提示:本地配置只适合开发者设备调试,不能当面向互联网的生产服务用。
Step 2:接入任意模型(以 GLM-5.2 为例)
2 厂商中立,不绑死一家
TrueForge 支持 OpenAI 兼容接口的任意模型,也可以接开源模型:
# 配置模型(支持 GLM / Qwen / DeepSeek / OpenAI 等)
trueforge config set-model glm-5.2
trueforge config set-api-key YOUR_KEY
# 或直接跑官方对比示例(GLM-5.2 + DevRev 基准)
trueforge run --benchmark devrev --model glm-5.2
💡 官方实测:GLM-5.2 驱动完成 14 项任务里的 11 项;若换 Opus 4.8 则 14 项全成、花费 8.5 美元,仍比 Claude 托管框架低 30%——换强模型收益更高。
Step 3:上手「上下文工程四招」
3 在配置里打开省钱开关
四招大多开箱即用,也可按需调参。核心配置项长这样:
# agent.yaml
compression:
enabled: true
threshold_tokens: 50000 # 默认 5 万 token 阈值,可按单代理调
strategy: summarize # 摘要压缩
tools:
lazy_schema: true # 延迟加载 MCP 工具 schema
result_offload: true # 大结果转文件,只留引用
sandbox:
on_demand: true # 核心循环跑在服务器上,需要时才开沙箱
subagents:
isolated_context: true # 子代理独立上下文
压缩是把双刃剑:阈值设太小,长任务里早期信息会被摘要丢掉;建议从官方默认 5 万 token 起步,观察任务完成率再调。
Step 4:理解「按需沙箱」
4 沙箱是工具,不是常驻环境
TrueForge 的沙箱机制与常规方案不同:核心代理循环始终运行在服务器上,只有需要执行代码或处理文件时才分配沙箱。好处显而易见:
传统做法:每个 Agent 常驻一个沙箱 → 算力被空转浪费
TrueForge:沙箱按需开、用完即回收
结果:单台服务器可同时运行更多 Agent
场景示例:
- Agent 只在「执行 Python / 跑测试 / 读写文件」时开沙箱
- 纯对话、规划、检索阶段不占沙箱资源
💡 这条设计对成本影响很大:沙箱就是算力,算力就是钱。按需分配后,同样的服务器能撑起更多并发 Agent。
Step 5:看实测账单,验证降本
5 同样的任务,钱差在哪?
| 方案 | 模型 | 任务完成 | 花费 |
|---|---|---|---|
| TrueForge | GLM-5.2(开源) | 11 / 14 | 2.9 美元 |
| TrueForge | Opus 4.8 | 14 / 14 | 8.5 美元 |
| Claude 托管代理框架 | Opus 4.8 | 14 / 14 | 11.8 美元 |
🚀 想要极致省钱:开源模型 + TrueForge 的组合(2.9 美元)比全托管方案便宜约 75%;想要全任务完成:自托管 + 旗舰模型仍比托管便宜 30%。
Step 6:迁移到生产(Docker Compose / Helm)
6 从本地 SQLite 到共享部署
本地跑通后,迁移到生产有两条官方路径:
# 方案 A:Docker Compose(小团队够用)
docker compose up -d # 自动拉起 Postgres + Redis + TrueForge
# 方案 B:Helm(Kubernetes 生产环境)
helm install trueforge ./charts/trueforge
# 两者都支持:
# - Postgres 替代 SQLite(多实例共享状态)
# - Redis 做队列与缓存
# - 对接 TrueFoundry 商业 AI 网关做统一路由与审计
🎉 恭喜,你已经从「本地试用」走到了「生产可用」。和同类开源框架(如 DeepSeek Harness)相比,TrueForge 的差异化在于厂商中立 + 清晰的本地到生产迁移路径。
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| 压缩后任务完成率下降 | 压缩阈值太小,把 threshold_tokens 调大或改用分阶段摘要 |
| MCP 工具第一次调用很慢 | 延迟加载的代价:首次调用要现拉 schema,属正常现象 |
| 本地模式被外部访问 | 本地模式未做鉴权,务必绑 localhost,生产必须走 Compose/Helm |
| 想接 DeepSeek Harness 插件 | 两个框架生态不同,不要混装;选一个主框架,用 MCP 标准互通工具 |