#多轮对话
共 20 条 · 7 天 1 条 · 30 天 4 条
信息流里打上「多轮对话」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
10月2日
9月30日
9月11日
9月3日
8月18日
8月12日
7月28日
7月26日
7月14日
EYT-Bench:以人为中心的多轮对话新基准,解耦用户模拟、目标建模与评判
这篇论文提出了EYT-Bench,能更真实地测出LLM在多轮对话中的意图追踪能力。用16/17模型发现推理模式大幅提升长上下文准确率,值得关注。
6月24日
论文12:08
多轮LLM对话中NFR评估的准确性与满意度这篇论文用49个程序员和148个实例,实测了GitHub Copilot评估HIPAA合规NFR的准确度,发现开发者容易被带偏,但主动交互反而让人更满意。
6月17日
论文09:37
DiagFlowBench:评估语言模型处理偏离流程输入的诊断对话DiagFlowBench这个新基准专门用来测语言模型在操作维护场景里,能不能识别用户问跑题的问题。10个模型测下来,差得挺大,而且那种看似合理但不对的答案最危险。论文值得一看。
6月11日
论文10:07
信息增益衡量多轮对话语义进展:无需LLM评判的新指标做对话系统评估的团队终于有了一个可复现、低成本的替代方案——无需调用大模型就能衡量对话的语义进展,建议做客服或问答系统的开发者试试这个指标。
6月5日
CogManip 基准测试:多轮对话中大模型的操纵行为风险
AI 安全研究者终于有了评估隐性操纵的专用工具——CogManip 覆盖 15 种策略、1000 个场景,做模型对齐和红队测试的团队可以直接拿来用。
6月2日
论文12:04
HarmAmp & TrajSafe:应对LLM多轮对话中的危害放大多轮对话中的危害放大是LLM安全部署的盲区,做AI安全或内容审核的团队可以关注HarmAmp基准和TrajSafe方案,直接用于评估和加固自己的模型。
5月22日
DataboxHQ 用 LangSmith 评估多轮分析智能体 Genie
做多轮对话智能体的团队终于有了可落地的评估方案——LangSmith 帮 Databox 把 Genie 的对话质量量化了,建议做 AI 分析助手的开发者点开看看具体怎么做的。
5月19日
5月15日
Self-Recall Thinking提升多轮对话一致性,F1提升4.7%
做对话系统或客服机器人的团队,SRT解决了长对话中信息稀疏和一致性差的痛点,无需外部模块就能提升效果,值得在长上下文场景中试试。
5月14日
小米MiMo多轮对话需保留推理内容,否则返回400错误
这个API变更直接影响使用小米MiMo模型的智能体开发者,尤其是多轮对话场景。如果你在用TRAE、Cursor等框架集成MiMo,建议立即检查代码,避免因缺失推理内容导致400错误和体验降级。