Agent Eval & 数据飞轮
主导构建 84 任务 / 160 页面 / 979 原子验收项真实业务 Benchmark;融合原生解析、截图与 Rule/LLM-as-a-Judge,基于 Trace 自动归因并驱动回归闭环,核心验收项覆盖率达 95%+。
Agent EvalBenchmarkTrace AttributionData Flywheel
主站技术部-运营技术部 · Agent开发 · 2026.8–至今
在快手负责 M0 Design(PRD → Figma → Code)Agent 的评测体系、Figma 结构化编辑及 MCP 接入建设:打通从生成、评测到生产调用的完整 Agent 链路,构建 84 任务 / 160 页面 / 979 验收项业务 Benchmark 与数据飞轮闭环。
主导构建 84 任务 / 160 页面 / 979 原子验收项真实业务 Benchmark;融合原生解析、截图与 Rule/LLM-as-a-Judge,基于 Trace 自动归因并驱动回归闭环,核心验收项覆盖率达 95%+。
将 Figma SceneGraph 序列化为 JSX 结构供模型读写并通过 Reconcile 安全写回;约束读写范围与元数据,在 143+ 自动测试下复杂修改成功率达到 95%+,减少 60%+ 细粒度工具调用。
将生稿能力封装为 MCP 接入内部 Agent,打通 Agent → MCP → Figma Runtime / Host 链路;治理写入超时与环境失效,复杂生稿 E2E 成功率提升至 95%+,并发异常率降低 50%+。
输出必须有明确目标身份、可编辑内容与结构约束;一次工具调用成功或非空返回不能替代交付验收。
Figma 结构快照、渲染视觉截图与需求语义各有独立证据来源。证据不足时明确保留未知,不用猜测补齐结论。
建立线上 Case → Eval → 自动归因 → 修复合入 → Regression 回归 → 数据集回灌的持续迭代闭环。
阅读智能体系统从一次生成到确定性交付的评测思考