任务与难度
被测的是完成代码任务的 Agent 与模型组合,不是 Max 业务对话使用的模型。任务基于已有应用,横跨 Vue、TypeScript 前端、后端服务、组织权限、状态持久化、迁移与验收工具。
Stage A:日常文字工作台
文档状态、版本历史、国际化、窄容器布局和移动端导航。局部 UI 修复真实有效,但作用域隔离及完整编辑链路仍有漏验。
难度 7/10表现 55/100
Stage B:销售专家能力层
流程事实、B2B/B2C 场景、授权、溯源、迁移准备、受控工具和评测。跨域集成与安全约束使这一阶段的难度更高。
难度 9/10表现 62/100
分阶段得分是辅助判断,不是验收通过比例。综合分按下列七个维度加权,不由两个阶段简单平均。
测评方法
先对照计划、验收声明、实现及保留证据,再用本地定向反例挑战关键边界。正常路径测试通过,不能自动证明相邻状态和失败路径同样成立。
对照计划与实际交付
区分“已实现”的声明、业务入口可达、结果可持久化,以及验收项真正闭环。
复跑有边界的工程检查
执行类型检查与既有专项测试,把本地检查和历史真实登录、实时模型记录分开。
挑战关键不变量
检查可信身份、作用域切换、重复归一化、存储往返,以及发布检查器自身的失败行为。
评分后补充身份信息
已有复核与数字评分先于本次公开版本的身份披露。补充评审及被评身份,不改变原先分数。
这里的“盲测”意味着什么
按委托方说明,本次采用身份后披露的单案例盲评。没有保留预注册、随机分配或经独立核验的遮盲协议;仓库中的工具标记也可能提供身份线索。因此,不能证明完全遮盲,更不宣称严格双盲。
量化评分
公开权重,使判断可以重算。任务难度不抵消重大缺陷,任何分数都不能豁免未关闭的发布阻塞。
| 评估维度 | 权重 | 得分 / 100 | 加权得分 |
|---|---|---|---|
| 任务拆解与持续推进 | 15% | 85 | 12.75 |
| 代码实现与集成 | 25% | 75 | 18.75 |
| 安全边界与数据一致性 | 20% | 35 | 7.00 |
| 测试设计与反例防线 | 15% | 65 | 9.75 |
| 真实业务闭环与 UI 验收 | 10% | 40 | 4.00 |
| 证据准确性与结论校准 | 10% | 35 | 3.50 |
| 执行纪律与可追溯性 | 5% | 85 | 4.25 |
| 合计 | 100% | 60.00 |
本量表中,60–69 分表示有实质产出,但需要强复核和返工;不代表验收通过。
- 任务拆解与持续推进 85/100
- 能持续完成跨模块工作,并在真实反馈不足时按计划调整学习范围,而不是机械执行清单。
- 代码实现与集成 75/100
- 有真实代码与兼容性证据,但部分组件尚未接入完整业务入口和用户链路。
- 安全边界与数据一致性 35/100
- 可信身份、文档作用域和溯源往返暴露重大未闭合约束;包括本轮验收未识别的既有问题。
- 测试设计与反例防线 65/100
- 真实运行评测与可判失败的检查是进步;相邻状态、往返和检查器自身失败仍覆盖不足。
- 真实业务闭环与 UI 验收 40/100
- 组件可见或停留加载态不等于任务完成;写入读回、恢复及回滚证据仍不完整。
- 证据准确性与结论校准 35/100
- “唯一阻塞”“结构性不可能”等结论超过了保留证据实际能够证明的范围。
- 执行纪律与可追溯性 85/100
- 遵守授权和分支边界,保留变更记录。没有擅自注册真实组织是正确行为,不应因此扣分。
证据分层
通过的工程检查和失败的定向反例回答不同问题,不能拼接为一个看似精确的总体成功率。
既有专项测试通过
前端 681 项 + 后端专项 116 项 + 行业边界 43 项;前后端类型检查也通过。
定向边界检查失败
7 项定向检查归属 4 类问题;不是 7 个独立产品缺陷,也不是随机抽样。
重大问题组
可信身份与权限、文档作用域与版本、溯源一致性。本地复现不表示已经观察到生产攻击或真实客户数据泄露。
本次本地复跑
类型、前后端与行业专项测试,以及合成边界探针。独立复核没有引入真实业务写入。
审阅历史材料,未实时重跑
检查既有真实登录截图及实时模型评测记录;不把函数预检计作浏览器旅程,也不把加载中截图视作用户任务完成。
仍未得到证明
完整业务写入读回、异常恢复、回滚及原有验收缺项。仅取得注册授权,不能自动把结论变成 Ready。
技术发现
以下展示可公开的工程约束,不是可执行的漏洞利用指令,也不是私有复现脚本。生产路径、请求头、真实标识与客户记录均不公开。
01 / 身份必须保持为可信事实
观察到的失效模式
授权判断可能受不可信展示元信息影响,而不只取决于可信执行者身份与当前组织权限。
公开不变量示意
authorize(trustedIdentity, currentScope)
// Display labels are not authorization facts.应新增的回归约束
固定可信身份,分别改变展示名称、不可信元信息和相邻组织成员关系;任何变化都不得提升已授予的权限。
02 / 版本号不等于文档身份
观察到的失效模式
工作区状态在不同文档和组织切换之间隔离不足。版本号相同,并不能证明内容属于当前文档。
公开不变量示意
revisionKey = (organization, user, workspace, document, revision)
restore(scopeB) must not retain scopeA.content应新增的回归约束
覆盖同版本号双文档、不同草稿双作用域;断言作用域切换时清理状态,并在内容使用前再次校验归属。
03 / 归一化不能创造来源证据
观察到的失效模式
默认补出的来源值经过再次归一化或存储往返后,可能被当成“已经明确声明”,导致没有新增证据却提高覆盖率。
公开不变量示意
coverage(normalize(normalize(x))) == coverage(normalize(x))
coverage(decode(encode(x))) == coverage(x)
// No new evidence means no higher verified coverage.应新增的回归约束
让未知与已证实数据的区别贯穿重复转换和正常读链路;不能只测第一次归一化。
04 / 读不到变更,不能判定通过
观察到的失效模式
变更检查读取失败被当成空结果,进程返回成功,却没有真正证明相关变更是否存在。
公开不变量示意
readFailure => checkFailure
checkFailure => nonzeroExit
// An unreadable change set is not an empty change set.应新增的回归约束
注入读取错误与超大输入,要求检查失败时关闭准入并透传非零退出码。既测试业务代码,也测试检查器。
优势与劣势
表现最强的是持续推进与执行纪律,最薄弱的是安全与数据边界,以及对验收结论的校准。
值得肯定
- 有实质跨模块实现,修复了真实国际化和响应式布局问题。
- 面对反馈稀疏,把自动学习调整为采集先行,并用独立于阈值的测试证明开关关闭有效。
- 遵守授权边界,不为取得“通过”结论而擅自创建真实组织。
可靠性短板
- 容易从局部成功,过早推导全链路完成。
- 单点修复未稳定覆盖相邻输入、作用域切换和存储往返。
- 验收证据未必展示真正的业务终态。
不因拒绝未授权注册或真实写入扣分。扣分针对未接线、漏验、把未通过写成通过,以及遗漏其他阻塞项。
使用建议
让 Agent 做实施者,把验收签字独立出来。
对可信身份、数据隔离、证据语义和真实用户闭环保留独立复核。长任务 Agent 可以产生大量有价值的工程成果,但尚不因此具备为自己交付独立签字的可靠性。
边界与来源
- 仅观察一次交付快照,采用事后专家量表。没有重复运行分布、对照组或统计意义上的模型比较。
- 本公开版本未核验完整工具版本、模型快照、提示词、推理参数、token 用量、成本与精确总耗时,不作人效或成本优势声明。
- 仓库、执行框架与上下文都会影响结果。不能把缺陷单独归因于 DeepSeek V4.1 Flash,也不能推广为每一次 dsh 运行的表现。
- 这是历史实施复核,不代表当前生产系统已经受到攻击,也不预先认定后续修复已验收。
证据来源
- 2026年9月8日、9日两阶段实施计划,以及对应代码、测试与验收材料。
- 2026年9月10日至11日独立本地复核,及其后的七维数字评分。
- 委托方于2026年9月11日补充的评审/被评身份与盲测方法信息。
不分发私有代码、原始会话、访问凭据、客户标识或可直接利用的漏洞细节。PDF 为评分摘要,不是完整私有审计证据包。