📝 第三章 章节测验
计分测验 · 通过线 60%
1. 教程称拒答断言(expect_refusal)是四类断言里「最确定」的一个,它的判定方式是什么?
A事件级判定:看事件流里有没有 knowledge.no_hit,不依赖任何模型判断
B由 judge 模型对拒答质量统一打分
C比对回复文本与标准答案的字符串相似度
D由人工抽查拒答样本逐条确认
2. 评测中 judge 用例忽绿忽红(评分在 2↔3 分之间摇摆),教程给出的正确校准动作是什么?
A降低 pass_score,迁就评分波动先把绿灯拿到
B把 judge 用例全部改写成 contains 断言
C改人设让行为更确定(如「第一句先共情,再解释规则」),从源头稳定行为——降分数线是最容易的作弊
D多跑几遍取最高分作为该用例的成绩
3. 逾期处理图跑到 human 节点(confirm_freeze)时,会发生什么?
A节点把请求转发给人工审批工具后自动继续往下执行
B流程暂停(interrupt),等人通过 resume 给值后才继续;确认发生之前,冻结在代码层面就不可能发生
C流程跳过该节点继续执行,只在日志里记录一条警告
D整个图运行失败并自动回滚已执行的节点
4. 多 Agent 团队中,supervisor(调度员)的产出是什么?
A一段给用户的自然语言最终答复
B对所有成员回复的逐字汇总
C一份动态生成的图流程定义,用来编排成员
D一个结构化 JSON 决策(如 {"action": "delegate", "agent": "..."} 或 {"action": "answer", ...}),路由是数据不是自然语言
5. LubanAgent 保证「跟上游升级不丢你的改动」(领地契约),其核心机制是什么?
Aapp/ 目录被 git 设置了保护,合并时会自动跳过
B上游承诺永远不修改仓库里的任何文件
C`.lubanagent-upstream` 清单文件把仓库里每个文件归类(framework / scaffold-seed / user-owned 等),合并冲突按类处理
D每次合并前手动备份 app/ 目录,合并后再还原