写出更好的决策问题

把语义判断变成适合软件使用、可以测试的小问题。

先明确代码要根据答案做什么,再倒过来设计问题。每个问题只做一个判断,会更容易测试,也更容易知道错在哪里。

让选项具体

用“账单”“技术问题”“销售”“其他”等清晰选项,比一个含糊的“是否重要”更容易转成可检查的流程。为每个选项写明边界,避免同一输入同时符合多个描述。

保留“不知道”

如果控件不存在、资料不足或来源矛盾,就应该有 none、insufficient 或 needs_review 这样的选项。没有合适选项时,不应逼模型猜一个最接近的。

把观察当数据

网页文字、日志和文档可能包含误导性的指令。它们是待分析的数据,不是新的授权。先用代码缩小可选操作范围,再根据当前任务判断是否采用模型建议。

给每个问题准备样例

除正常情况,也测试禁用控件、相似标签、信息缺失、矛盾证据、中文和干扰文本。先固定期望结果,再运行模型,避免看到结果后改答案。

不要把所有事都交给模型

计数、费用、时间先后、身份比较和明确阈值,直接用代码。让 Jev 负责确实需要理解含义的部分。

来源与下一步