Nexus 与 Claude Agent SDK 实测,内存低六成、成本更低、交付更稳

六道工程题、36 次运行,双方代码均通过检查。Nexus 峰值内存中位数低 60.1%,正常完成 17 次,Claude 为 11 次;成功配对的 API 等价费用低 16.7%。

我们让 Nexus Agent SDK 和 Claude Agent SDK 完成六道工程题,每题各运行三次,共 36 次尝试。双方留下的代码都通过了独立检查,Nexus 有 17 次返回成功结果,Claude 有 11 次。Nexus 的峰值内存中位数低 60.1%,模型请求少 17.3%。

两套 SDK 都接入 GLM-5.3-Flash。我们记录了每次运行的内存、CPU 时间、模型用量和完成情况。

nxs 是 Nexus 的 Agent Runtime,用 Go 开发,负责调用模型、执行工具和管理上下文。nexus-agent-sdk-python 将它封装成 Python 异步接口。此前,我们用 nxs 跑过 FrontierHarness 的 30 道题,通过 22 道。这次选了六道自建工程题,每题重复三次。

实验条件

项目配置
设备Apple M1 Pro,16 GiB 内存,macOS,Python 3.11.7
NexusPython SDK 0.1.0,nxs Runtime
ClaudePython SDK 0.2.152,内置 Claude Code 2.1.259
模型服务智谱 Coding Plan,glm-5.3-flash,Anthropic 兼容接口
推理参数thinking 开启,effort 为 high,输出上限 16,384 Token
运行预算每次 600 秒,SDK max_turns=24
工具Bash、Read、Edit、Write、Glob、Grep,全部允许
重复次数每题每套 SDK 三次,共 36 次

max_turns 按各 SDK 的规则计数,模型请求数另行记录。

每次运行都新建会话,放入相同的任务文件,传入相同的系统提示和任务文字,不加载个人配置或跨会话记忆。两套 SDK 轮流先跑,一次只运行一个任务。模型请求经过同一个计量代理,推理参数在这里统一,用量按服务端返回值记录。

六道题都要求只用 Python 标准库。Agent 能看到需求和公开检查,隐藏测试在运行结束后执行。

题目检查内容
支付退款对账乱序事件、重复事件与累计退款
发布依赖计划环、下游依赖与长链
SSE 流解析分块输入、Unicode、emoji 与换行
机房容量冲突时区、相邻区间与容量超限
钥匙与传送门迷宫获得钥匙后的重访、出口与门
异步请求合并等待者取消与共享请求的生命周期

本机资源占用

资源统计包含 Python 宿主、Runtime 和工具进程,每 100 毫秒采样一次。下表取各自 18 次运行的中位数,包括达到轮次或时间上限的尝试。

本机资源NexusClaudeNexus 降幅
峰值 RSS 中位数125.9 MiB315.2 MiB60.1%
采样 CPU 时间中位数2.58 秒10.99 秒76.5%

两套 SDK 各 18 次运行的峰值 RSS 与采样 CPU 时间

Nexus 的峰值内存中位数比 Claude 少约 189 MiB。表中的 CPU 时间是本机计算开销,等待模型回复的时间另计。采样可能漏掉短命进程,RSS 相加可能重复计入共享页。

任务完成率

36 份代码都通过了隐藏测试,但有八次运行在返回成功结果前达到了轮次或时间上限。下面把代码通过且在预算内返回成功结果的运行记为“正常完成”。

运行结果NexusClaude
代码通过独立检查18/1818/18
代码通过且返回成功17/1811/18
达到轮次上限16
达到十分钟上限01

六道题各三轮的耗时与退出结果,36 份代码均通过检查

迷宫题中,Nexus 前两轮在 569.3 秒和 422.5 秒完成,第三轮在 508.5 秒耗尽轮次。Claude 三轮都达到轮次上限,留下的代码仍然通过了检查。

Nexus 正常完成 17 次,比 Claude 多六次,完成率从 61.1% 提高到 94.4%,相差 33.3 个百分点。

Nexus 有五道题三次都正常完成,Claude 有两道。三次中至少完成过一次的题目,分别为六道和五道。

不同等待时长下的交付率

每套 SDK 各运行 18 次。下图记录任务开始后,不同时间点已有多少次正常完成。

十分钟实验中,随等待时间增加的正常完成数量

前三分钟,Claude 完成两次,Nexus 完成一次。六分钟时,Nexus 完成 13/18,Claude 完成 7/18;八分钟时,分别为 16/18 和 10/18。这些时间点都取自本轮十分钟实验。

连同未正常完成的尝试一起计算,总耗时除以成功次数,Nexus 每份成功结果分摊 342.5 秒,Claude 为 578.6 秒。

请求数与逐题耗时

Nexus 共发出 249 次模型请求,Claude 为 301 次,少 17.3%。工具调用分别为 275 次和 344 次。Write 与 Edit 合计分别为 47 次和 97 次,Bash 为 168 次和 181 次。

六道题各三次尝试的模型请求总数

SSE 题中,Nexus 三轮都正常完成,Claude 两轮耗尽轮次。依赖计划题中,Claude 三轮耗时均低于 Nexus。

按题目和轮次配对,双方都正常完成的有 11 组。Nexus 快六组,Claude 快五组,累计耗时分别为 49.8 分钟和 54.0 分钟。

双方均正常完成的 11 组配对耗时

异步请求合并题第一轮,Nexus 用了 470.1 秒,Claude 用了 349.1 秒;第二轮变成 256.0 秒和 551.3 秒。两轮中较快的一方发生了变化。

计入缓存折扣后的费用

本次使用 Coding Plan 套餐,费用按公开 API 单价折算,不是套餐实扣。Claude 有一条中断请求缺少完整用量,因此费用表只计入双方正常完成、用量完整的 11 组配对。其余尝试的费用未计入。

智谱 API 定价,GLM-5.3-Flash 每百万 Token 的未缓存输入、缓存命中和输出价格分别为 0.8 元、0.23 元和 2.8 元,核对日期为 2026 年 9 月 13 日。

11 组成功配对NexusClaude
未缓存输入费用0.1572 元0.1735 元
缓存读取费用0.3305 元0.4542 元
输出费用0.4346 元0.4798 元
合计0.9224 元1.1075 元
每份成功结果0.0839 元0.1007 元

分项四舍五入,合计按原始用量计算。

11 组成功配对的未缓存输入、缓存读取与输出等价费用

Nexus 的等价费用低 16.7%。差额约 0.1852 元,其中缓存读取贡献约 0.1237 元,占 66.8%。这组配对里,Nexus 的缓存命中率为 88.0%,Claude 为 90.1%;Nexus 每次请求的平均输入为 12,283 Token,Claude 为 15,220 Token。Claude 的缓存命中率高 2.1 个百分点,每次请求的平均输入也多了 2,937 Token。

本轮测试范围是 GLM-5.3-Flash 下的六道工程题,未测试长会话、大型仓库或多会话并发。

快速开始

准备 Python 3.11 或更高版本,安装 SDK 并配置 Anthropic API Key。

python -m pip install nexus-agent-sdk-python
export ANTHROPIC_API_KEY="替换为你的 Anthropic API Key"

在项目目录运行下面的程序,用 query() 提交任务并接收回复。

import asyncio

from nexus_agent_sdk import NexusAgentOptions, query


async def main():
    options = NexusAgentOptions(
        tools=["Read"],
        allowed_tools=["Read"],
    )
    async for message in query(
        prompt="阅读当前目录的 README.md,用中文介绍这个项目。",
        options=options,
    ):
        print(message)


asyncio.run(main())

模型配置、多轮对话与自定义工具见 Python SDK 使用指南

实验资料