技能与 AI 助手同源生成对比:十个原生案例

同一组需求共用界面契约、教学数据与素材,分别生成十个工程。技能路线由 Codex 按 ai2-app 技能生成;助手实际请求编辑器默认模型,系统提示词取自生产 AIAssistantBrain / AiPromptBudget,积木使用生产同源编译器和转换器。首测结果、失败原因和修复次数在 docs/native-apps-benchmark/reports/comparison-results.json 留档。生成工作目录已清理,最终可编辑源码统一保留在专题 .aia 中。

此次集中比较逻辑正确性与业务完成度;助手共用界面,不能据此评价从零设计界面的能力。测试账号到期,编辑器内完整生成/导出仍待可用账号验收。

📊 首次与最终结果

指标 技能 助手同源
发现问题 0.29 金额误拒绝;视频评论重开未显示;文件范围枚举误用 文本误用列表积木;嵌套 return 未阻止错误金额;视频未恢复 Source;分享文件路径不正确
助手首轮完整脚本产出及转换 不适用,Codex 直接编写并迭代 8 / 10;购物、点餐先给计划,后续生成脚本(点餐另有一次转换修复)
源码转换后的业务首测 初次失败摘要已保留,测试器与配置问题另记 6 / 10(剔除测试器缺项和等价格式误判)
最终业务与工程检查 10 / 10 10 / 10
真机与伴侣 待最后实测 待最后实测

双方人工迭代程度不同,不能用首测数字宣称总体能力排名。最终结果说明两种路线能产出可编辑、可导入、可编译并满足本组业务用例的工程;实际交互质量仍需真机检验。

🎨 本轮界面与技能改进

十类业务分别采用商品网格、图文卡片、深色音乐台、视频主视图、大字号计时、收支总览、任务管理、地图与聊天会话结构。两条路线共享此次人工界面升级,不能据此把新版界面计作某个模型独立设计的成绩。

技能路线对照助手较好的细节,补充了购物/点餐订单的创建时间、状态与可读详情,以及地图定位等待、超时、重试和成功后停止计时。新业务断言验证这些改进;原首测摘要仍单独保留。

ai2-app 技能新增按业务选结构、操作细节和截图来源规范,修正旧的多屏跳转能力说明。预览器增加真实列表数据绑定、双列卡片与隐藏面板支持,避免用同一张静态模板冒充各应用。专题截图均关联最终 .aia 哈希,明确标为 HTML 界面预览。

🛠️ 已落地改进

  • 技能补充金额精度、筛选后按 ID 操作、保存后从界面重新读取内容的检查。
  • 助手生产提示词区分 length / textLength、contains / textContains,提醒整数分金额、重开读取、固定确认框目标,以及文件范围枚举和普通文本的区别。
  • 生产编译器不再静默丢弃带外层后续语句的嵌套 return;不支持的退出形态明确报错,并新增原失败形态回归。正常顶层守卫保持可用。
  • 正式 .aia 检查器补充连接失败的积木类型诊断,并支持批量读取更大的工程数据。
  • 业务测试器严格校验列表类型,显式支持实际输出中的标准积木;对等价字段、金额单位、行绑定和播放队列作适配,避免把实现选择误记为错误。

🔎 复查证据

最终 SHA-256 同时出现在案例页、下载摘要和工程报告。工程报告位于 docs/native-apps-benchmark/reports/final-projects.json,业务报告为 business-final.json。首次失败和生成、修复结果摘要保留在 comparison-results.json,原始回复和草稿归档已清理。

测试器执行最终 BKY,未知积木与组件调用会失败;它不模拟 Android UI。聊天实际 GET/POST SQLite 服务,用两个独立客户端验证通信和房间隔离。

返回源码下载表。

文档反馈