长任务 Agent:实施能力强,交付闭环仍不足 https://touch.long-arena.com/ai-evaluations/max-long-task-2026-09/ 测评日期: 2026-09-11 独立复核 Max 日常文字工作台与销售专家能力层两份计划。有实质性工程产出,并不意味着已经具备可靠的独立交付能力。 计划实施难度: 8.5/10 本次交付表现: 60/100 独立验收结论: blocked (reviewed-historical-snapshot) 测评者:Agent + 模型: Codex + GPT-6 Astra 被测对象:Agent + 模型: dsh + DeepSeek V4.1 Flash Agent 与模型身份由委托方于2026年9月11日提供。本次未独立核验执行会话、请求 ID 或锁定的模型版本。 Codex 是评审方,不是参赛实施方。本案例不是 Codex 与 DeepSeek 的同题对照试验,不构成基础模型排名或供应商背书。 任务与难度 被测的是完成代码任务的 Agent 与模型组合,不是 Max 业务对话使用的模型。任务基于已有应用,横跨 Vue、TypeScript 前端、后端服务、组织权限、状态持久化、迁移与验收工具。 Stage A:日常文字工作台 文档状态、版本历史、国际化、窄容器布局和移动端导航。局部 UI 修复真实有效,但作用域隔离及完整编辑链路仍有漏验。 7/10; 55/100 Stage B:销售专家能力层 流程事实、B2B/B2C 场景、授权、溯源、迁移准备、受控工具和评测。跨域集成与安全约束使这一阶段的难度更高。 9/10; 62/100 分阶段得分是辅助判断,不是验收通过比例。综合分按下列七个维度加权,不由两个阶段简单平均。 测评方法 盲测:先评分,后披露身份 按委托方说明,本次采用身份后披露的单案例盲评。没有保留预注册、随机分配或经独立核验的遮盲协议;仓库中的工具标记也可能提供身份线索。因此,不能证明完全遮盲,更不宣称严格双盲。 对照计划与实际交付 区分“已实现”的声明、业务入口可达、结果可持久化,以及验收项真正闭环。 复跑有边界的工程检查 执行类型检查与既有专项测试,把本地检查和历史真实登录、实时模型记录分开。 挑战关键不变量 检查可信身份、作用域切换、重复归一化、存储往返,以及发布检查器自身的失败行为。 评分后补充身份信息 已有复核与数字评分先于本次公开版本的身份披露。补充评审及被评身份,不改变原先分数。 量化评分 综合得分 = 各维度得分 × 对应权重,再求和。 任务拆解与持续推进: 85/100; 15%; 12.75 能持续完成跨模块工作,并在真实反馈不足时按计划调整学习范围,而不是机械执行清单。 代码实现与集成: 75/100; 25%; 18.75 有真实代码与兼容性证据,但部分组件尚未接入完整业务入口和用户链路。 安全边界与数据一致性: 35/100; 20%; 7.00 可信身份、文档作用域和溯源往返暴露重大未闭合约束;包括本轮验收未识别的既有问题。 测试设计与反例防线: 65/100; 15%; 9.75 真实运行评测与可判失败的检查是进步;相邻状态、往返和检查器自身失败仍覆盖不足。 真实业务闭环与 UI 验收: 40/100; 10%; 4.00 组件可见或停留加载态不等于任务完成;写入读回、恢复及回滚证据仍不完整。 证据准确性与结论校准: 35/100; 10%; 3.50 “唯一阻塞”“结构性不可能”等结论超过了保留证据实际能够证明的范围。 执行纪律与可追溯性: 85/100; 5%; 4.25 遵守授权和分支边界,保留变更记录。没有擅自注册真实组织是正确行为,不应因此扣分。 本量表中,60–69 分表示有实质产出,但需要强复核和返工;不代表验收通过。 证据分层 通过的工程检查和失败的定向反例回答不同问题,不能拼接为一个看似精确的总体成功率。 既有专项测试通过: 840 (681 + 116 + 43) 定向边界检查失败: 7; 重大问题组: 3 本次本地复跑 类型、前后端与行业专项测试,以及合成边界探针。独立复核没有引入真实业务写入。 审阅历史材料,未实时重跑 检查既有真实登录截图及实时模型评测记录;不把函数预检计作浏览器旅程,也不把加载中截图视作用户任务完成。 仍未得到证明 完整业务写入读回、异常恢复、回滚及原有验收缺项。仅取得注册授权,不能自动把结论变成 Ready。 技术发现 01 / 身份必须保持为可信事实 授权判断可能受不可信展示元信息影响,而不只取决于可信执行者身份与当前组织权限。 authorize(trustedIdentity, currentScope) // Display labels are not authorization facts. 固定可信身份,分别改变展示名称、不可信元信息和相邻组织成员关系;任何变化都不得提升已授予的权限。 02 / 版本号不等于文档身份 工作区状态在不同文档和组织切换之间隔离不足。版本号相同,并不能证明内容属于当前文档。 revisionKey = (organization, user, workspace, document, revision) restore(scopeB) must not retain scopeA.content 覆盖同版本号双文档、不同草稿双作用域;断言作用域切换时清理状态,并在内容使用前再次校验归属。 03 / 归一化不能创造来源证据 默认补出的来源值经过再次归一化或存储往返后,可能被当成“已经明确声明”,导致没有新增证据却提高覆盖率。 coverage(normalize(normalize(x))) == coverage(normalize(x)) coverage(decode(encode(x))) == coverage(x) // No new evidence means no higher verified coverage. 让未知与已证实数据的区别贯穿重复转换和正常读链路;不能只测第一次归一化。 04 / 读不到变更,不能判定通过 变更检查读取失败被当成空结果,进程返回成功,却没有真正证明相关变更是否存在。 readFailure => checkFailure checkFailure => nonzeroExit // An unreadable change set is not an empty change set. 注入读取错误与超大输入,要求检查失败时关闭准入并透传非零退出码。既测试业务代码,也测试检查器。 值得肯定 有实质跨模块实现,修复了真实国际化和响应式布局问题。 面对反馈稀疏,把自动学习调整为采集先行,并用独立于阈值的测试证明开关关闭有效。 遵守授权边界,不为取得“通过”结论而擅自创建真实组织。 可靠性短板 容易从局部成功,过早推导全链路完成。 单点修复未稳定覆盖相邻输入、作用域切换和存储往返。 验收证据未必展示真正的业务终态。 不因拒绝未授权注册或真实写入扣分。扣分针对未接线、漏验、把未通过写成通过,以及遗漏其他阻塞项。 让 Agent 做实施者,把验收签字独立出来。 对可信身份、数据隔离、证据语义和真实用户闭环保留独立复核。长任务 Agent 可以产生大量有价值的工程成果,但尚不因此具备为自己交付独立签字的可靠性。 边界与来源 仅观察一次交付快照,采用事后专家量表。没有重复运行分布、对照组或统计意义上的模型比较。 本公开版本未核验完整工具版本、模型快照、提示词、推理参数、token 用量、成本与精确总耗时,不作人效或成本优势声明。 仓库、执行框架与上下文都会影响结果。不能把缺陷单独归因于 DeepSeek V4.1 Flash,也不能推广为每一次 dsh 运行的表现。 这是历史实施复核,不代表当前生产系统已经受到攻击,也不预先认定后续修复已验收。 证据来源 2026年9月8日、9日两阶段实施计划,以及对应代码、测试与验收材料。 2026年9月10日至11日独立本地复核,及其后的七维数字评分。 委托方于2026年9月11日补充的评审/被评身份与盲测方法信息。 不分发私有代码、原始会话、访问凭据、客户标识或可直接利用的漏洞细节。PDF 为评分摘要,不是完整私有审计证据包。 下载评分摘要 · 中文 PDF: https://touch.long-arena.com/reports/2026-09-11-agent-long-task-assessment.pdf 3 页 · 中文 · 历史评分摘要