先明确代码要根据答案做什么,再倒过来设计问题。每个问题只做一个判断,会更容易测试,也更容易知道错在哪里。
让选项具体
用“账单”“技术问题”“销售”“其他”等清晰选项,比一个含糊的“是否重要”更容易转成可检查的流程。为每个选项写明边界,避免同一输入同时符合多个描述。
保留“不知道”
如果控件不存在、资料不足或来源矛盾,就应该有 none、insufficient 或 needs_review 这样的选项。没有合适选项时,不应逼模型猜一个最接近的。
把观察当数据
网页文字、日志和文档可能包含误导性的指令。它们是待分析的数据,不是新的授权。先用代码缩小可选操作范围,再根据当前任务判断是否采用模型建议。
给每个问题准备样例
除正常情况,也测试禁用控件、相似标签、信息缺失、矛盾证据、中文和干扰文本。先固定期望结果,再运行模型,避免看到结果后改答案。
不要把所有事都交给模型
计数、费用、时间先后、身份比较和明确阈值,直接用代码。让 Jev 负责确实需要理解含义的部分。