// WQIZHAO · INTERN REPORT · 2026
01 / 18
INTERNSHIP · FINAL REPORT

构建可靠的
AI Agent 系统

智能文档 · 智能表格 · 智能助理 · 三项核心工作复盘

Author
wqizhao
Team
腾讯 · WXG 微信事业群
企业微信应用部 / 企业协作产品开发团队
Duration
2026.06 — 2026.09
Months
4
AI
DECK / TABLE OF CONTENTS
02 / 18
// SECTION MAP
目录 · Contents
00
实习概览
TIMELINE · KEY METRICS · CONTRIBUTIONS
P.03
01
智能文档嵌入智能应用
LLM AGENT · CRUD SYSTEM · SANDBOX RUNTIME
P.04 — P.07
02
公式统一 DSL 架构改造
EXCEL-LIKE DSL · PYTHON COMPILER · SKILL CONVERGENCE
P.08 — P.11
03
智能表格 Skill 优化
CLOSED-LOOP OPTIMIZATION · SKILLOPT
P.12 — P.15
04
数据成果 & 总结展望
METRICS · GROWTH · NEXT STEPS
P.16 — P.18
OVERVIEW / KEY METRICS
03 / 18
// 00 · INTERNSHIP OVERVIEW
4 个月 · 3 大项目 · 8 项核心数据提升
首轮代码通过率
90%
LLM Agent 生成 CRUD 系统
↑ 从 20% 提升 · +70pt
复杂公式评测通过率
91.32%
类 Excel DSL 编译器
↑ 从 68.23% 提升 · +23.09pt
智能表任务准确率
87%
Skill 闭环优化
↑ 从 75% 提升 · +12pt
Skill 首文件瘦身
17.9KB
Token 成本大幅下降
↓ 从 36.2KB · -50.6%
// 实习时间线 · 2026.06 — 2026.09
4 MONTHS · 3 CORE PROJECTS
6 月 · 入职 & 智能表 Skill 优化
7 月 · 智能文档嵌入应用
8 月 · 公式 DSL 改造
9 月 · 收尾 & 专利 & 答辩
▸ 角色定位
Agent 系统研发实习生 · 参与从 Prompt 设计、Skill 优化、智能应用开发实现到评测闭环搭建的全链路工作
▸ 技术栈
Python React TypeScript shadcn/ui E2B MCP Prompt Eng. DSL Compile
▸ 额外产出
▸ 1 项发明专利已申请
▸ 1 个自研 CLI 工具已上线
▸ 1 套评测分析 Skill 沉淀
CHAPTER 01 / 03
04 / 18
01
PROJECT 01 · LLM AGENT + CLOUD SANDBOX

企业微信智能文档
嵌入智能应用

基于智能表格数据,LLM Agent 根据自然语言需求在云端沙箱中
生成 CRUD 业务管理系统,通过 iframe 集成运行

System Prompt Design Sandbox Runtime shadcn/ui + E2B
PROJECT 01 / BACKGROUND & ARCHITECTURE
05 / 18
// 01.01 · 背景 & 系统架构
让 LLM 在云端沙箱里生成可运行的业务系统
01 项目定位
  • 输入:用户自然语言需求 + 智能表格数据 Schema
  • 处理:LLM Agent 在云端沙箱中生成完整 CRUD 应用代码
  • 输出:可交互业务系统,通过 iframe 集成到智能文档
  • 价值:让业务人员用一句话搭建轻量业务系统,无需前端开发
02 典型使用场景
// CRM
客户跟进管理系统
// TASK
项目任务看板
// INVENTORY
库存 & 出入库登记
// FAQ
知识库录入与检索
03 系统架构
USER LAYER
智能文档 · 自然语言输入
↓
AGENT LAYER
LLM Agent · System Prompt · Tools
↓
RUNTIME LAYER
E2B 沙箱 + 只读 Runtime + 数据 SDK
↓
INTEGRATION
iframe 嵌入 · 智能文档 SmartCanvas
PROJECT 01 / AGENT DESIGN
06 / 18
// 01.02 · 核心贡献 A · AGENT DESIGN
System Prompt & 代码生成协议 & Tool 设计
// 首轮对话交付通过率
20% ▶▶▶ 90%
用户一句话描述需求 → 首轮对话内交付可运行的完整 CRUD 系统
// Tool Call 失败率
▼ -25%
通过参数约束前置、正反例注入、必填清单显式化
▸ 数据来源 & 验证
▸ 现网 Trace 采样 > 500 条
▸ 内部评测集覆盖 12 类业务场景
▸ A/B 对比 3 个 Prompt 版本
▸ 双周迭代 · 持续回归
▸ 四大设计维度
  • SQL 安全边界
    只读白名单 + 参数化查询,禁止 DDL / 跨表写入越权,避免 Agent 生成危险语句
  • Schema 字段映射
    动态注入表结构,字段类型 → UI 组件自动映射规则,杜绝硬编码枚举
  • UI 规范
    统一表单/表格/筛选器组件语法,视觉一致性由规范锁定
  • CRUD 流程标准化
    增删改查四种操作的乐观更新 & 错误回退协议,交互体验统一
  • 渐进式披露
    高频规则前置,低频/复杂规则按需加载,压缩上下文成本
PROJECT 01 / SANDBOX & SDK
07 / 18
// 01.03 · 核心贡献 B · RUNTIME ENGINEERING
分层沙箱模板 + Checkpoint 归档恢复
A 分层沙箱模板
  • 业务代码层:Agent 生成,可写
  • Runtime 层:只读,稳定 API
  • 隔离粒度到进程级,异常不污染宿主
  • 模板初始化时间 < 800ms
B 组件与 SDK 预置
  • 50+ shadcn/ui 组件预装
  • 数据读写 SDK:insertRecord / updateRecord / deleteRecord
  • 字段选项 hook:useFieldOptions
  • 关联列与人员选择器组件
C 归档 & 续编
  • E2B 提供沙箱执行环境
  • COS Checkpoint 快照代码状态
  • 支持多副本并行编辑
  • 支持跨轮次续编,还原上下文
▸ 沙箱运行时链路
用户 Prompt
→
Agent 生成代码
→
E2B 沙箱拉起
→
Runtime 注入 SDK
→
代码执行 & 校验
→
Checkpoint 归档
→
iframe 嵌入
// SANDBOX BOOT
<800ms
冷启动到可执行代码 · 模板化预热
// UI COMPONENTS
50+
shadcn/ui 组件 · 表单/表格/图表全套
// CHECKPOINT
∞ 副本
COS 归档 · 跨轮续编 · 无缝还原
CHAPTER 02 / 03
08 / 18
02
PROJECT 02 · EXCEL-LIKE DSL COMPILER

公式统一
DSL 架构改造

将 LLM 从拼装 formulaModel JSON 转为生成类 Excel DSL
SmartSheet + SmartPage 双链路收敛为公共公式 Skill

Python Compiler 80+ Functions Patent Filed
PROJECT 02 / PROBLEM & SOLUTION
09 / 18
// 02.01 · 问题定位 & 解决方案
让 LLM 写类 Excel公式,而不是拼 JSON
✕ 改造前 · 痛点
  • LLM 需拼装嵌套 formulaModel JSON,字段类型、引用路径、嵌套层级都易出错
  • 复杂用例:3 分钟以上、多次重试仍失败,用户体验断崖
  • SmartSheet / SmartPage 两条链路各维护公式说明,知识重复、实现割裂
  • Skill 上下文膨胀,模型认知负担重,token 成本高
✓ 改造后 · 方案
  • LLM 只生成人类可读的 类 Excel DSL,如 SUMIF([销售额], "华东", >1000)
  • 后端 Python 公式编译器将 DSL 编译为 formulaModel JSON 或页面公式字符串
  • 公式知识单份维护,分层渐进披露,模型按需加载
  • 结构化错误码 + 2 轮定向修复,替代盲目重试
// 复杂公式评测通过率
68.23% ▶▶▶ 91.32%
+23.09pt · 针对复杂公式评测集,覆盖 SmartSheet + SmartPage 双链路
// 典型复杂用例响应
3min+ × ▶▶▶ <30s ✓
多次重试仍失败 → 一次成功;相关技术已申请发明专利
PROJECT 02 / PYTHON COMPILER
10 / 18
// 02.02 · PYTHON 公式编译器
从 DSL 到 formulaModel 的完整编译链路
▸ 编译链路 · Compile Pipeline
DSL 源码
→
Rewrite 纠错
→
Lexer 词法
→
Parser 语法
→
AST
→
静态校验
→
SmartSheet: formulaModel
/
SmartPage: 页面公式字符串
01 函数覆盖
80+
数值 / 文本 / 日期 / 逻辑 / 查找引用 / 聚合
支持嵌套调用与跨表引用
02 错误码 & 修复
2 轮
结构化错误码 → 定向修复提示
LLM 收到具体错误后定向修复,避免盲改
03 逆翻译能力
↔
formulaModel → DSL 逆翻译
支持在已有公式基础上修改或更新
// STACK
Python · AST · Rewrite
// 静态校验规则
类型 · 引用 · 循环依赖 · 参数
// 输出目标
SmartSheet + SmartPage 双端
// 专利
已申请 · 文档写公式方案
PROJECT 02 / SKILL CONVERGENCE
11 / 18
// 02.03 · SKILL 架构收敛
双链路 → 单一真理源 · 分层渐进披露
BEFORE 改造前 · 分裂架构
SmartSheet SKILL
公式说明 A · formulaModel 拼装规则
SmartPage SKILL
公式说明 B · 页面公式字符串规则
MAINTENANCE COST
同一函数需两处同步维护
CONTEXT COST
两份公式知识全量注入模型上下文
问题:知识重复维护 · 实现割裂 · 上下文冗余 · 认知负担重
AFTER 改造后 · 统一架构
COMMON SKILL
wecom-smart-formula (公共)
SMARTSHEET
→ 调用公共 Skill
SMARTPAGE
→ 调用公共 Skill
UNIFIED SCHEMA
DSL Schema · 统一编译入口
PROGRESSIVE LOADING
分层披露 · 按需加载,压缩上下文
收益:单份维护 · 双端统一 · 分层披露 · 上下文成本显著下降
CHAPTER 03 / 03
12 / 18
03
PROJECT 03 · CLOSED-LOOP OPTIMIZATION

智能助理"大圆"
智能表格 Skill 优化

优化任务解析、工具调用、结果输出规范
搭建"回归 → 归因 → 迭代"闭环 · 探索 SkillOpt 自动优化

Task Accuracy 75% → 87% Skill Slimming -50.6% SkillOpt Auto-Opt
PROJECT 03 / SKILL SLIMMING
13 / 18
// 03.01 · SKILL 瘦身 & 规范优化
更小的 Skill · 更准的 Agent
// 智能表格任务准确率
75% ▶▶▶ 87%
+12pt · 现网真实数据驱动的持续优化
// Skill 首文件体积
36.2 KB ▶▶▶ 17.9 KB
-50.6% · Token 成本大幅下降,模型专注度提升
▸ 三大规范优化方向
// TASK PARSING
任务解析
▸ 明确意图分类边界
▸ 高频意图前置披露
▸ 低频复杂意图按需加载
▸ 意图路由偏差修正
⤷ 意图识别准确率 ↑
// TOOL CALL
工具调用
▸ 参数约束下沉到 description
▸ 枚举值 / 正反例显式化
▸ 必填清单速查表
▸ 前置 get_info 强约束
⤷ CGI 错误率 ↓
// OUTPUT
结果输出
▸ 统一响应结构
▸ 数据展示格式规范
▸ 错误提示统一话术
▸ 减少冗余解释文本
⤷ Token 消耗 ↓
PROJECT 03 / CLOSED-LOOP
14 / 18
// 03.02 · 闭环优化流程
测试用例 · 现网日志 · 归因 · 迭代验证
▸ 四步闭环 · Closed Loop
01
测试用例回归
覆盖高频意图,跑分建立基线
↓
02
现网日志分析
Trace 现网真实调用,识别失败模式
↓
03
失败模式归因
多维度错误分类,定位根因
↓
04
Skill 迭代验证
针对性修订,回归测试确认收益
▸ 现网数据驱动的典型归因
失败类型 占比 Skill 优化动作
参数值问题 25.3% 枚举值/必填清单显式化
docid 类型错误 17.2% 前缀映射 + get_info 强约束
参数格式错误 14.9% 正反例注入
子表 sheet 问题 13.8% 调用前先取 sheet_id 字段列表
▸ 闭环成效
+12pt
任务准确率提升
-50.6%
Skill 体积下降
1 Skill
评测流程沉淀
沉淀:Trace 分析→归因→写表 流程沉淀为独立评测 Skill,一键批量处理评测问题
PROJECT 03 / SKILLOPT EXPLORATION
15 / 18
// 03.03 · SKILLOPT 自动优化探索
把 Skill 当作可训练的参数
▸ 核心思想
引入 SkillOpt 文本空间优化框架,将大圆作为目标 Agent 接入;以测试集与标答要点作为奖励信号,让 Skill 像模型参数一样被自动优化。
REWARD
测试集 + 标答
TARGET
大圆 Agent
SEARCH SPACE
Skill 文本
类比:把过去依赖工程师经验的 Skill 手工迭代,变成可测量、可自动化的"梯度下降"
▸ 前置工程支撑
  • 自研企业微信智能助理 CLI,实现与 Agent 的多轮自动对话
  • 自动处理 Agent 弹出的问卷、确认卡片、文本追问
  • 基于本地 MCP Server,为 SkillOpt 提供稳定执行接口
  • 为 Skill 自动测评 & 自动优化打通端到端链路
MCP
本地服务
多轮
自动对话
E2E
测评闭环
▸ Skill 自动优化闭环
Skill v_n
→
大圆 Agent 执行测试集
→
对比标答自动评分
→
反思生成 Skill 编辑
→
验证门控
→
Skill v_n+1
意义:把过去依赖人工经验的 Skill 迭代,转化为可扩展、可测量、可自动化的工程流程;为后续大规模 Skill 演化奠定基础
SUMMARY / KEY METRICS
16 / 18
// 04.01 · 数据成果一览
3 个项目 · 8 项关键指标
项目 关键指标 改造前 改造后 提升幅度
智能文档嵌入应用 首轮对话交付通过率 20% 90% ↑ +70pt
Tool Call 失败率 基线 -25% ↓ 显著下降
公式 DSL 改造 复杂公式评测通过率 68.23% 91.32% ↑ +23.09pt
典型复杂用例响应 3min+ 多次重试失败 <30s 一次成功 ↑ 数量级提升
智能表 Skill 优化 智能表任务准确率 75% 87% ↑ +12pt
Skill 首文件体积 36.2 KB 17.9 KB ↓ -50.6%
额外产出 发明专利 — 已申请 1 项 《一种智能助理中文档写公式的解决方案》
工程沉淀 企业微信助理 CLI 工具 — 已上线 支撑 SkillOpt 自动测评
// AGENT SYSTEM
首轮 20% → 90%
让 LLM 一次交付可用业务系统,从"能不能跑"跨越到"直接可用"
// FORMULA DSL
3min → 30s · 专利已申请
双链路收敛为公共 Skill + Python 编译器,复杂用例响应数量级提升
// SKILL OPT
75% → 87% · CLI 已上线
Skill 瘦身 50.6%,闭环流程沉淀 · 为 SkillOpt 自动优化打下地基
SUMMARY / GROWTH & NEXT
17 / 18
// 04.02 · 总结与展望
从写 Skill 到造 Agent 系统
▸ 三项个人成长
01 · ENGINEERING
工程能力
从写业务代码到设计 Agent 系统:编译器、沙箱、SDK、闭环工具链
Python · Compiler Sandbox · E2B CLI · MCP
02 · AGENT SYSTEM
Agent 系统认知
System Prompt / Tool 设计 / Skill 分层披露 / DSL 编译 / 沙箱运行时的完整方法论
Prompt Design Skill Arch DSL
03 · DATA-DRIVEN
数据驱动方法论
用真实数据说话 · 现网 Trace 分析 · 评测集回归 · 归因驱动迭代
Trace Analysis Eval Loop A/B Test
▸ 下阶段方向
▸ SkillOpt 落地
从探索走向生产:让 Skill 自动优化闭环稳定跑通,验证在多 Skill 上的可迁移性;建立 Skill 版本管理与回滚机制
▸ 公式能力扩展
DSL 编译器支持更多函数、跨文档引用与后台验算;补充多函数嵌套、跨步骤依赖测试集
▸ 智能应用生态
沉淀更多可复用业务模板,让"一句话生成业务系统"成为企微文档场景的标准能力
▸ 长期愿景
推动企微智能助理从"能用"到"好用",让 Agent 系统的能力持续可测、可扩、可自优化
END OF DECK
18 / 18
Thanks.
Q   &   A
// wqizhao · WXG 微信事业群 · 企业微信应用部 · 企业协作产品开发团队 · 2026.09