Nexus 与 Claude Agent SDK 实测,内存低六成、成本更低、交付更稳
六道工程题、36 次运行,双方代码均通过检查。Nexus 峰值内存中位数低 60.1%,正常完成 17 次,Claude 为 11 次;成功配对的 API 等价费用低 16.7%。
我们让 Nexus Agent SDK 和 Claude Agent SDK 完成六道工程题,每题各运行三次,共 36 次尝试。双方留下的代码都通过了独立检查,Nexus 有 17 次返回成功结果,Claude 有 11 次。Nexus 的峰值内存中位数低 60.1%,模型请求少 17.3%。
两套 SDK 都接入 GLM-5.3-Flash。我们记录了每次运行的内存、CPU 时间、模型用量和完成情况。
nxs 是 Nexus 的 Agent Runtime,用 Go 开发,负责调用模型、执行工具和管理上下文。nexus-agent-sdk-python 将它封装成 Python 异步接口。此前,我们用 nxs 跑过 FrontierHarness 的 30 道题,通过 22 道。这次选了六道自建工程题,每题重复三次。
实验条件
| 项目 | 配置 |
|---|---|
| 设备 | Apple M1 Pro,16 GiB 内存,macOS,Python 3.11.7 |
| Nexus | Python SDK 0.1.0,nxs Runtime |
| Claude | Python SDK 0.2.152,内置 Claude Code 2.1.259 |
| 模型服务 | 智谱 Coding Plan,glm-5.3-flash,Anthropic 兼容接口 |
| 推理参数 | thinking 开启,effort 为 high,输出上限 16,384 Token |
| 运行预算 | 每次 600 秒,SDK max_turns=24 |
| 工具 | Bash、Read、Edit、Write、Glob、Grep,全部允许 |
| 重复次数 | 每题每套 SDK 三次,共 36 次 |
max_turns 按各 SDK 的规则计数,模型请求数另行记录。
每次运行都新建会话,放入相同的任务文件,传入相同的系统提示和任务文字,不加载个人配置或跨会话记忆。两套 SDK 轮流先跑,一次只运行一个任务。模型请求经过同一个计量代理,推理参数在这里统一,用量按服务端返回值记录。
六道题都要求只用 Python 标准库。Agent 能看到需求和公开检查,隐藏测试在运行结束后执行。
| 题目 | 检查内容 |
|---|---|
| 支付退款对账 | 乱序事件、重复事件与累计退款 |
| 发布依赖计划 | 环、下游依赖与长链 |
| SSE 流解析 | 分块输入、Unicode、emoji 与换行 |
| 机房容量冲突 | 时区、相邻区间与容量超限 |
| 钥匙与传送门迷宫 | 获得钥匙后的重访、出口与门 |
| 异步请求合并 | 等待者取消与共享请求的生命周期 |
本机资源占用
资源统计包含 Python 宿主、Runtime 和工具进程,每 100 毫秒采样一次。下表取各自 18 次运行的中位数,包括达到轮次或时间上限的尝试。
| 本机资源 | Nexus | Claude | Nexus 降幅 |
|---|---|---|---|
| 峰值 RSS 中位数 | 125.9 MiB | 315.2 MiB | 60.1% |
| 采样 CPU 时间中位数 | 2.58 秒 | 10.99 秒 | 76.5% |

Nexus 的峰值内存中位数比 Claude 少约 189 MiB。表中的 CPU 时间是本机计算开销,等待模型回复的时间另计。采样可能漏掉短命进程,RSS 相加可能重复计入共享页。
任务完成率
36 份代码都通过了隐藏测试,但有八次运行在返回成功结果前达到了轮次或时间上限。下面把代码通过且在预算内返回成功结果的运行记为“正常完成”。
| 运行结果 | Nexus | Claude |
|---|---|---|
| 代码通过独立检查 | 18/18 | 18/18 |
| 代码通过且返回成功 | 17/18 | 11/18 |
| 达到轮次上限 | 1 | 6 |
| 达到十分钟上限 | 0 | 1 |

迷宫题中,Nexus 前两轮在 569.3 秒和 422.5 秒完成,第三轮在 508.5 秒耗尽轮次。Claude 三轮都达到轮次上限,留下的代码仍然通过了检查。
Nexus 正常完成 17 次,比 Claude 多六次,完成率从 61.1% 提高到 94.4%,相差 33.3 个百分点。
Nexus 有五道题三次都正常完成,Claude 有两道。三次中至少完成过一次的题目,分别为六道和五道。
不同等待时长下的交付率
每套 SDK 各运行 18 次。下图记录任务开始后,不同时间点已有多少次正常完成。

前三分钟,Claude 完成两次,Nexus 完成一次。六分钟时,Nexus 完成 13/18,Claude 完成 7/18;八分钟时,分别为 16/18 和 10/18。这些时间点都取自本轮十分钟实验。
连同未正常完成的尝试一起计算,总耗时除以成功次数,Nexus 每份成功结果分摊 342.5 秒,Claude 为 578.6 秒。
请求数与逐题耗时
Nexus 共发出 249 次模型请求,Claude 为 301 次,少 17.3%。工具调用分别为 275 次和 344 次。Write 与 Edit 合计分别为 47 次和 97 次,Bash 为 168 次和 181 次。

SSE 题中,Nexus 三轮都正常完成,Claude 两轮耗尽轮次。依赖计划题中,Claude 三轮耗时均低于 Nexus。
按题目和轮次配对,双方都正常完成的有 11 组。Nexus 快六组,Claude 快五组,累计耗时分别为 49.8 分钟和 54.0 分钟。

异步请求合并题第一轮,Nexus 用了 470.1 秒,Claude 用了 349.1 秒;第二轮变成 256.0 秒和 551.3 秒。两轮中较快的一方发生了变化。
计入缓存折扣后的费用
本次使用 Coding Plan 套餐,费用按公开 API 单价折算,不是套餐实扣。Claude 有一条中断请求缺少完整用量,因此费用表只计入双方正常完成、用量完整的 11 组配对。其余尝试的费用未计入。
按 智谱 API 定价,GLM-5.3-Flash 每百万 Token 的未缓存输入、缓存命中和输出价格分别为 0.8 元、0.23 元和 2.8 元,核对日期为 2026 年 9 月 13 日。
| 11 组成功配对 | Nexus | Claude |
|---|---|---|
| 未缓存输入费用 | 0.1572 元 | 0.1735 元 |
| 缓存读取费用 | 0.3305 元 | 0.4542 元 |
| 输出费用 | 0.4346 元 | 0.4798 元 |
| 合计 | 0.9224 元 | 1.1075 元 |
| 每份成功结果 | 0.0839 元 | 0.1007 元 |
分项四舍五入,合计按原始用量计算。

Nexus 的等价费用低 16.7%。差额约 0.1852 元,其中缓存读取贡献约 0.1237 元,占 66.8%。这组配对里,Nexus 的缓存命中率为 88.0%,Claude 为 90.1%;Nexus 每次请求的平均输入为 12,283 Token,Claude 为 15,220 Token。Claude 的缓存命中率高 2.1 个百分点,每次请求的平均输入也多了 2,937 Token。
本轮测试范围是 GLM-5.3-Flash 下的六道工程题,未测试长会话、大型仓库或多会话并发。
快速开始
准备 Python 3.11 或更高版本,安装 SDK 并配置 Anthropic API Key。
python -m pip install nexus-agent-sdk-python
export ANTHROPIC_API_KEY="替换为你的 Anthropic API Key"
在项目目录运行下面的程序,用 query() 提交任务并接收回复。
import asyncio
from nexus_agent_sdk import NexusAgentOptions, query
async def main():
options = NexusAgentOptions(
tools=["Read"],
allowed_tools=["Read"],
)
async for message in query(
prompt="阅读当前目录的 README.md,用中文介绍这个项目。",
options=options,
):
print(message)
asyncio.run(main())
模型配置、多轮对话与自定义工具见 Python SDK 使用指南。