{
  "$schema": "https://touch.long-arena.com/ai-evaluations/schema.json",
  "schemaVersion": "1.0",
  "kind": "single-task-expert-assessment",
  "id": "max-long-task-2026-09",
  "language": "zh-CN",
  "canonicalUrl": "https://touch.long-arena.com/ai-evaluations/max-long-task-2026-09/",
  "title": "长任务 Agent：实施能力强，交付闭环仍不足",
  "description": "独立复核 Max 日常文字工作台与销售专家能力层两份计划。有实质性工程产出，并不意味着已经具备可靠的独立交付能力。",
  "reviewDate": "2026-09-11",
  "reviewWindow": [
    "2026-09-10",
    "2026-09-11"
  ],
  "planDates": [
    "2026-09-08",
    "2026-09-09"
  ],
  "sampleSize": 1,
  "identity": {
    "reviewer": {
      "agent": "Codex",
      "model": "GPT-6 Astra"
    },
    "subject": {
      "agent": "dsh",
      "model": "DeepSeek V4.1 Flash"
    },
    "source": "commissioner-declared",
    "runIdentityVerified": false,
    "disclosure": "Agent 与模型身份由委托方于2026年9月11日提供。本次未独立核验执行会话、请求 ID 或锁定的模型版本。"
  },
  "method": {
    "id": "identity-disclosed-after-scoring",
    "label": "盲测：先评分，后披露身份",
    "maskingVerified": false,
    "limitations": "按委托方说明，本次采用身份后披露的单案例盲评。没有保留预注册、随机分配或经独立核验的遮盲协议；仓库中的工具标记也可能提供身份线索。因此，不能证明完全遮盲，更不宣称严格双盲。",
    "notAHeadToHeadModelComparison": true,
    "comparisonLimit": "Codex 是评审方，不是参赛实施方。本案例不是 Codex 与 DeepSeek 的同题对照试验，不构成基础模型排名或供应商背书。",
    "steps": [
      {
        "title": "对照计划与实际交付",
        "body": "区分“已实现”的声明、业务入口可达、结果可持久化，以及验收项真正闭环。"
      },
      {
        "title": "复跑有边界的工程检查",
        "body": "执行类型检查与既有专项测试，把本地检查和历史真实登录、实时模型记录分开。"
      },
      {
        "title": "挑战关键不变量",
        "body": "检查可信身份、作用域切换、重复归一化、存储往返，以及发布检查器自身的失败行为。"
      },
      {
        "title": "评分后补充身份信息",
        "body": "已有复核与数字评分先于本次公开版本的身份披露。补充评审及被评身份，不改变原先分数。"
      }
    ]
  },
  "assessment": {
    "verdict": "blocked",
    "verdictScope": "reviewed-historical-snapshot",
    "difficulty": {
      "value": 8.5,
      "maximum": 10
    },
    "performance": {
      "value": 60,
      "maximum": 100,
      "method": "weighted-expert-judgment"
    },
    "dimensions": [
      {
        "id": "execution",
        "weight": 15,
        "score": 85,
        "label": "任务拆解与持续推进",
        "reason": "能持续完成跨模块工作，并在真实反馈不足时按计划调整学习范围，而不是机械执行清单。",
        "contribution": 12.75
      },
      {
        "id": "implementation",
        "weight": 25,
        "score": 75,
        "label": "代码实现与集成",
        "reason": "有真实代码与兼容性证据，但部分组件尚未接入完整业务入口和用户链路。",
        "contribution": 18.75
      },
      {
        "id": "security",
        "weight": 20,
        "score": 35,
        "label": "安全边界与数据一致性",
        "reason": "可信身份、文档作用域和溯源往返暴露重大未闭合约束；包括本轮验收未识别的既有问题。",
        "contribution": 7
      },
      {
        "id": "testing",
        "weight": 15,
        "score": 65,
        "label": "测试设计与反例防线",
        "reason": "真实运行评测与可判失败的检查是进步；相邻状态、往返和检查器自身失败仍覆盖不足。",
        "contribution": 9.75
      },
      {
        "id": "journey",
        "weight": 10,
        "score": 40,
        "label": "真实业务闭环与 UI 验收",
        "reason": "组件可见或停留加载态不等于任务完成；写入读回、恢复及回滚证据仍不完整。",
        "contribution": 4
      },
      {
        "id": "calibration",
        "weight": 10,
        "score": 35,
        "label": "证据准确性与结论校准",
        "reason": "“唯一阻塞”“结构性不可能”等结论超过了保留证据实际能够证明的范围。",
        "contribution": 3.5
      },
      {
        "id": "discipline",
        "weight": 5,
        "score": 85,
        "label": "执行纪律与可追溯性",
        "reason": "遵守授权和分支边界，保留变更记录。没有擅自注册真实组织是正确行为，不应因此扣分。",
        "contribution": 4.25
      }
    ],
    "scale": "本量表中，60–69 分表示有实质产出，但需要强复核和返工；不代表验收通过。",
    "stages": [
      {
        "id": "a",
        "planDate": "2026-09-08",
        "difficulty": 7,
        "score": 55,
        "title": "Stage A：日常文字工作台",
        "body": "文档状态、版本历史、国际化、窄容器布局和移动端导航。局部 UI 修复真实有效，但作用域隔离及完整编辑链路仍有漏验。"
      },
      {
        "id": "b",
        "planDate": "2026-09-09",
        "difficulty": 9,
        "score": 62,
        "title": "Stage B：销售专家能力层",
        "body": "流程事实、B2B/B2C 场景、授权、溯源、迁移准备、受控工具和评测。跨域集成与安全约束使这一阶段的难度更高。"
      }
    ],
    "stageScoreLimit": "分阶段得分是辅助判断，不是验收通过比例。综合分按下列七个维度加权，不由两个阶段简单平均。"
  },
  "evidence": {
    "existingTests": {
      "frontend": 681,
      "backend": 116,
      "industry": 43
    },
    "totalExistingTests": 840,
    "targetedChecksFailed": 7,
    "failureClasses": 4,
    "severeGroups": 3,
    "interpretation": "通过的工程检查和失败的定向反例回答不同问题，不能拼接为一个看似精确的总体成功率。",
    "layers": [
      {
        "title": "本次本地复跑",
        "body": "类型、前后端与行业专项测试，以及合成边界探针。独立复核没有引入真实业务写入。"
      },
      {
        "title": "审阅历史材料，未实时重跑",
        "body": "检查既有真实登录截图及实时模型评测记录；不把函数预检计作浏览器旅程，也不把加载中截图视作用户任务完成。"
      },
      {
        "title": "仍未得到证明",
        "body": "完整业务写入读回、异常恢复、回滚及原有验收缺项。仅取得注册授权，不能自动把结论变成 Ready。"
      }
    ]
  },
  "technicalFindings": [
    {
      "id": "identity",
      "title": "01 / 身份必须保持为可信事实",
      "finding": "授权判断可能受不可信展示元信息影响，而不只取决于可信执行者身份与当前组织权限。",
      "lesson": "固定可信身份，分别改变展示名称、不可信元信息和相邻组织成员关系；任何变化都不得提升已授予的权限。",
      "invariant": "authorize(trustedIdentity, currentScope)\n// Display labels are not authorization facts."
    },
    {
      "id": "scope",
      "title": "02 / 版本号不等于文档身份",
      "finding": "工作区状态在不同文档和组织切换之间隔离不足。版本号相同，并不能证明内容属于当前文档。",
      "lesson": "覆盖同版本号双文档、不同草稿双作用域；断言作用域切换时清理状态，并在内容使用前再次校验归属。",
      "invariant": "revisionKey = (organization, user, workspace, document, revision)\nrestore(scopeB) must not retain scopeA.content"
    },
    {
      "id": "provenance",
      "title": "03 / 归一化不能创造来源证据",
      "finding": "默认补出的来源值经过再次归一化或存储往返后，可能被当成“已经明确声明”，导致没有新增证据却提高覆盖率。",
      "lesson": "让未知与已证实数据的区别贯穿重复转换和正常读链路；不能只测第一次归一化。",
      "invariant": "coverage(normalize(normalize(x))) == coverage(normalize(x))\ncoverage(decode(encode(x))) == coverage(x)\n// No new evidence means no higher verified coverage."
    },
    {
      "id": "gate",
      "title": "04 / 读不到变更，不能判定通过",
      "finding": "变更检查读取失败被当成空结果，进程返回成功，却没有真正证明相关变更是否存在。",
      "lesson": "注入读取错误与超大输入，要求检查失败时关闭准入并透传非零退出码。既测试业务代码，也测试检查器。",
      "invariant": "readFailure => checkFailure\ncheckFailure => nonzeroExit\n// An unreadable change set is not an empty change set."
    }
  ],
  "strengths": [
    "有实质跨模块实现，修复了真实国际化和响应式布局问题。",
    "面对反馈稀疏，把自动学习调整为采集先行，并用独立于阈值的测试证明开关关闭有效。",
    "遵守授权边界，不为取得“通过”结论而擅自创建真实组织。"
  ],
  "weaknesses": [
    "容易从局部成功，过早推导全链路完成。",
    "单点修复未稳定覆盖相邻输入、作用域切换和存储往返。",
    "验收证据未必展示真正的业务终态。"
  ],
  "authorizationDiscipline": "不因拒绝未授权注册或真实写入扣分。扣分针对未接线、漏验、把未通过写成通过，以及遗漏其他阻塞项。",
  "conclusion": {
    "title": "让 Agent 做实施者，把验收签字独立出来。",
    "body": "对可信身份、数据隔离、证据语义和真实用户闭环保留独立复核。长任务 Agent 可以产生大量有价值的工程成果，但尚不因此具备为自己交付独立签字的可靠性。"
  },
  "limitations": [
    "仅观察一次交付快照，采用事后专家量表。没有重复运行分布、对照组或统计意义上的模型比较。",
    "本公开版本未核验完整工具版本、模型快照、提示词、推理参数、token 用量、成本与精确总耗时，不作人效或成本优势声明。",
    "仓库、执行框架与上下文都会影响结果。不能把缺陷单独归因于 DeepSeek V4.1 Flash，也不能推广为每一次 dsh 运行的表现。",
    "这是历史实施复核，不代表当前生产系统已经受到攻击，也不预先认定后续修复已验收。"
  ],
  "sources": [
    "2026年9月8日、9日两阶段实施计划，以及对应代码、测试与验收材料。",
    "2026年9月10日至11日独立本地复核，及其后的七维数字评分。",
    "委托方于2026年9月11日补充的评审/被评身份与盲测方法信息。"
  ],
  "privateEvidenceExcluded": "不分发私有代码、原始会话、访问凭据、客户标识或可直接利用的漏洞细节。PDF 为评分摘要，不是完整私有审计证据包。",
  "representations": {
    "json": "https://touch.long-arena.com/ai-evaluations/max-long-task-2026-09/article.json",
    "text": "https://touch.long-arena.com/ai-evaluations/max-long-task-2026-09/article.txt",
    "summaryPdf": "https://touch.long-arena.com/reports/2026-09-11-agent-long-task-assessment.pdf",
    "summaryPdfLanguage": "zh-CN"
  }
}
