已记录的合成案例 / 2026 年 9 月 27 日归档核查
复杂资料,
执行过程清晰可查。
一次已完成的真实模型合成案例运行:13 张表、2,749,851 条索引记录,34 个不同席位、114 次交接事件。源数据清单摘要与运行记录一致。分析时间不含前置导入;资料库规模不等于每条记录均进入模型提示。
记录中的协调:3 个主控会话、14 个协调会话与 22 个分析会话。事件日志含 6 个假设关口事件,不等于 6 次人工审批。这些记录不证明独立场景中的 1M 上下文或 5/0 关口配置。
记录中的 Token 台账 · 查看分配
| 角色 | 未缓存输入 | 缓存写入 | 缓存读取 | 输出 |
|---|---|---|---|---|
| 分析角色 (22) | 396 | 525,270 | 3,149,781 | 150,463 |
| 协调角色 (14) | 50 | 46,402 | 107,217 | 18,828 |
| 主控角色 (3) | 12 | 14,038 | 27,411 | 7,236 |
| 合计 | 458 | 585,710 | 3,284,409 | 176,527 |
记录 Token 共 4,047,104,包含缓存输入;分析与协调输入 Token 中 84.9% 为缓存读取。缓存读取仍是 Token,并非 Token 消除。独立复核的 86 份日志另记 499,967 个“tokens used”,但无输入、输出、缓存拆分,未混入上方服务商用量分类。
在线模型快速对比 · DeepSeek 计价
使用 2026 年 9 月 27 日核查的 DeepSeek 美元公开单价,对分析与协调 Token 组合重新计价。原运行记录模型别名“sonnet”,对应记录费用小计 $4.766。此处为价格表测算,不是 DeepSeek 实际执行、完整运行账单或质量对比。
| 公开模型 | 非高峰估算 | 高峰估算 |
|---|---|---|
| DeepSeek-V4.1-Flash | $0.204 | $0.407 |
| DeepSeek-V4-Pro-0813 | $0.809 | $1.617 |
公式:缓存读取 Token × 命中单价 +(未缓存输入 + 缓存写入 Token)× 未命中单价 + 输出 Token × 输出单价,再除以一百万。不含复核、硬件、导入与服务费用。实际运行的分词、推理长度、缓存行为、质量与时延均可能不同。
DeepSeek 官方 API 同样支持工具调用与结构化输出。公平对比应在相同数据上比较建木编排与明确配置的工具基线,而非假设普通模型不能使用工具。
官方模型规格与单价 ↗来源核算与范围
只读核查检查事件序列、最终裁定修正、数据清单摘要和会话唯一性。用量仅累加会话顶层汇总,不重复累加内部迭代。38 项候选发现最终为 13 项已核验、2 项假设及 23 项驳回;这些是复核状态,不是独立评测准确率。34 个席位表示运行期间的不同角色,不是同时并发测量。
下载脱敏核算摘要 ↓合成工作负载 / 场景测算
同样 1 TB,
不同的处理方式。
河口计划:一个虚构的采购调查场景,涉及支付、通信、合同、扫描件与系统日志。分析支付链、关联实体与矛盾点,并将发现连接到原始资料。
A / 场景基线
串行模型流程
由模型重复读取、分析与复核,各阶段顺序执行。
- 模型 Token 预算
- 42.00 B
- 测算总用时
- 1,176.7 h
B / 建木场景
混合执行工作流
脚本处理记录,专业角色按需读取依据,独立任务并行执行。
- 模型 Token 预算
- 1.74 B
- 测算总用时
- 22.5 h
同一个 1 TB 合成工作负载,对比不同执行策略与假设吞吐。以上为预算测算,不是模型实测结果。同为 40,000 Token/秒时:301.7 小时对比 22.5 小时,即 13.4 倍。基线不代表 DeepSeek、Claude 或所有多智能体系统。
采用十进制单位。假设提取 120 GB 文本,按 4 字节/Token 估算,为 300 亿 Token 等价量。二进制存储字节不直接折算模型 Token。本页计算工作负载,不包含或实际处理 1 TB 数据集。
分层协作 + 确定性计算
数百项任务,
只传递必要上下文。
核心价值 / 持续承接更复杂的工作
承接更高复杂度,
让目标与依据持续连贯。
面向更大的工作跨度:更多依赖、更长的分析过程、更多专业分支,由可见状态、来源引用与复核共同连接。成本与时间衡量效率,持续可控决定项目能推进多远。
协调场景假设,并非实测需求。一个活跃主控使用两个连续上下文分段,不是一个无限提示。自动模式仅在预授权范围内不安排固定暂停;未决异常及重要权限仍可能需要人工处理。
对比会话、交接与人工关口
| 指标 | 人工协调模型流程 | 具备自动编排的 MAS | Jianmu |
|---|---|---|---|
| 项目层主控 | 1 个活跃项目会话 | 本配置为 1 个根角色 | 1 个活跃 L1 席位 |
| 主控上下文分段 | 2 | 2 | 2 |
| 分段间交接 | 1 次人工状态交接 | 配置后自动交接 1 次 | 本场景进行 1 次结构化接续 |
| 任务层人工操作 | 1,000 次:每包交办与复核各一次 | 策略自动处理时无预设人工操作 | 自动任务策略下无预设人工操作 |
| 项目人工关口 | 本引导策略为 5 次 | 支持对应策略时:引导 5 次 / 自动 0 次 | 引导 5 次 / 自动 0 次 |
| 工作席位与会话 | 500 个工作包是工作项,不等于 500 个同时活跃席位。实际会话数取决于复用、重试、消息长度、上下文装载和部署限制。仅凭 1M 窗口无法推导数量。 | ||
人工基线明确假设每个工作包都由人交办和复核:500 × 2 + 5 个项目关口 = 1,005 次流程操作,另有一次上下文交接。这是配置的人工作业量,不是 1,005 次强制安全审批,也不是所有竞品的必然要求。自动化 MAS 可以实现类似控制策略。
上下文计算:500 份精简结果 × 2,000 Token,加上指令、决策及工作状态预算 400,000 Token,共 1.4M 主控侧独立内容。1M 窗口预留 20% 余量,可用容量 800k;向上取整 1.4M ÷ 800k,得到 2 段。此简化预算不计重复传输,并假设交接摘要适配预留容量。工作角色模型流量另计;不能用场景中的 17.4 亿处理 Token 除以 1M 推算会话数。
五个人工关口决定什么
- 确认目标、资料范围与权限边界。
- 确认分析计划与验收标准。
- 扩展任务前检查代表性样本。
- 处理重大矛盾与例外决策。
- 接收最终依据包并授权交付。
引导模式将这些决策保留给人。示例自动策略预先定义范围内决策及验收规则,不绕过人的权限、不取消核验,也不承诺永不中断。
长期稳定性、漂移控制与经验积累
保留不变约束
在上下文交接中保留目标、来源编号、约束、已确认决策、未决问题及下一步,检查遗漏,减少对对话记忆的单独依赖。
依据驱动修复
重算确定性操作、独立复核解释,并对修复结果再次核查。矛盾保持可见直至处理;接收标签本身不等于事实正确。
积累经过复核的知识
受控学习循环记录修正与可复用方法,经回放案例评估后,将批准版本纳入项目记忆或规则。这是受治理的知识复用,不等于自动训练模型权重,也不保证每次更新都带来提升。
此处不赋予漂移概率:应在长任务与多次交接中测量约束保留、引用正确性、依赖遗漏与恢复情况。智能体更多或窗口更大,本身都不能证明这些比率。
一个活跃项目控制器
维护目标、验收标准与共享状态;自动接续向下一 L1 上下文转交精简状态包。第二控制器可复核交接完整性。
500 个逻辑工作包
按来源、时间窗口与分析问题分区。本场景最多调度 32 个活跃执行槽位,并非 500 路模型同时调用。
工作包内的专业分工
抽取、实体消歧、解释与独立复核角色按需激活。脚本承担精确计算,冲突结果定向回流修复。
检测算力,配置队列。
根据 CPU、内存、显存、存储吞吐、模型上下文及工具可用性调整并发宽度。席位数量本身不等于吞吐量。
任务可视,交接可控。
任务树呈现排队、执行、阻塞、待审与已接收状态。共享依赖受协调;上下文交接保留来源编号及未决问题。
以上席位数量与 L2/L3 编排为本场景配置,不是对所有部署的并发承诺。
可复算的计算过程
节省来自哪里。
活跃调用的汇总核算吞吐,包含输入与输出。速率为假设值,不代表实测硬件或模型表现。
| 阶段 | 串行模型流程 | 重复上下文 MAS | Jianmu |
|---|---|---|---|
| 01 / 接收与标准化 | 24,000 | 26,000 | 400 |
| 02 / 深度分析 | 12,000 | 16,000 | 850 |
| 03 / 工具与辅助函数 | 2,000 | 4,500 | 90 |
| 04 / 核验与修复 | 2,500 | 6,000 | 360 |
| 05 / 接续与交付 | 1,500 | 2,500 | 40 |
| 合计 | 42,000 M | 55,000 M | 1,740 M |
查看逐步方法与公式
01 / 接收与标准化
脚本完成指纹校验、去重、解析、索引与聚合;模型接收选定异常及结构样本。
建木非模型关键路径用时预算: 6 h02 / 深度分析
L2 协调角色为工作包按需激活 L3 专业角色,以相关窗口、实体键与来源引用替代反复传递全集材料。
建木非模型关键路径用时预算: 1.5 h03 / 工具与辅助函数
复用查询与脚本完成连接、求和、时间差及图谱候选计算;模型处理解释与例外。
建木非模型关键路径用时预算: 1.5 h04 / 核验与修复
独立上下文与不同模型通道交叉复核候选发现。确定性检查核对引用和计算;未解决分歧保持待审。
建木非模型关键路径用时预算: 1 h05 / 接续与交付
一个活跃 L1 控制器向后继上下文转交有界状态;任务树保留依赖、发现、阻塞与下一步。
建木非模型关键路径用时预算: 0.4 hToken 减少 = 1 − 1,740 / 42,000 = 95.857%。用时 = Token 总量 ÷ 有效每秒速率 ÷ 3,600 + 非模型关键路径用时预算。串行流程为 10 小时,MAS 为 12 小时,建木为 10.4 小时。32 槽位不再额外乘算,其效果已包含在汇总吞吐中。
串行基线包含文本重复读取、分析与复核;示例 MAS 增加共享上下文和复核消息。建木 17.4 亿预算假设使用选择性依据路由及脚本执行。这些预算是场景设定,并非分词日志或实测提取比例。采用优化检索或工具的系统可缩小差距;基线不代表任何具体模型厂商或 MAS 框架。
下载测算输入 ↓质量不只来自模型意见一致
复核每项发现,
保留每条依据。
机械核验
重算金额、检查时间边界、验证来源编号并重放数据连接。缺失引用阻止接收;依据不足的解释保留待审。
独立复核
独立上下文与模型通道核查依据及反例。模型意见一致不直接等于事实,仍须通过来源和规则检查。
明确的质量门槛
本场景要求每项被接收发现具备可查来源引用与复核记录。这是验收规则,不是事实准确率 100% 的声明。
独立的已归档合成案例 / 来自所提供合作简报
2026 年 9 月 27 日 Partner v2 简报记载 1,817 条事件、34 个不同席位及两次裁定修正。以上是最终归档标签,并非独立评测准确率或同时并发数;该归档与前述 1 TB 测算是两个不同案例。
比较准确性需对照独立标准答案,统计精确率、召回率、引用正确率及重复运行波动。Token 减少本身不能证明这些指标。