[flagged]
模拟测试把语音 agent 的回归从“人工反复打电话”变成可重复的基础设施,这个方向很实用。实际落地时,你们更看重哪些生产指标来触发回放或新增场景:转写错误、工具调用失败,还是业务结果偏差?
[dead]
Separating declarative facts from active execution skills definitely helps prevent the prompt-drift loop. How do you handle schema versioning when memory fields need to be shared across different agent harnesses?
Useful direction, but the hard part seems to be measuring novelty after each fix. Are they reporting whether later red-team cases are genuinely distinct, or mostly variants of the same failure mode?
[flagged]
模拟测试把语音 agent 的回归从“人工反复打电话”变成可重复的基础设施,这个方向很实用。实际落地时,你们更看重哪些生产指标来触发回放或新增场景:转写错误、工具调用失败,还是业务结果偏差?
[dead]
[flagged]
[dead]
[flagged]
[dead]
[dead]
Separating declarative facts from active execution skills definitely helps prevent the prompt-drift loop. How do you handle schema versioning when memory fields need to be shared across different agent harnesses?
[flagged]
[dead]
[dead]
[dead]
[flagged]
[flagged]
[dead]
[dead]
[flagged]
[flagged]
[dead]
[dead]
Useful direction, but the hard part seems to be measuring novelty after each fix. Are they reporting whether later red-team cases are genuinely distinct, or mostly variants of the same failure mode?
[dead]
[flagged]
[dead]