微软研究访谈:把AI评估放回真实的多轮任务
访谈将单轮基准与实际使用区分开,并介绍模拟用户逐步澄清任务的方法及相应研究观察。
微软研究播客刊载了与研究经理Jennifer Neville的访谈。她指出,传统基准往往比实际使用场景简单,评估应先明确用户希望系统完成什么,再考察多轮行为、协作环境和长期任务;这些讨论属于受访研究人员对评估方法的说明。
Neville介绍,团队将已有单轮基准中的完整指令改为由模拟用户分多轮逐步澄清,观察模型处理任务的方式。她报告,在这种研究设置下,模型表现会随多轮交互明显下降;这是一项特定评估观察,不应外推为所有模型或所有对话都有相同降幅。
针对逐步澄清后模型失去方向的情况,她提出一种交互建议:重新开始对话,将已经明确的要求一次完整说明。访谈同时强调核对模型回答,并保留监督和验证;这类建议不等于保证每次有效,也不是已经可以把所有任务无条件交给AI处理的结论。
资料来源与责任信息
已完成人工复核。