主要来源arXiv: Anthropic
查看原文事件专题 · 官方一手
LLM可视化素养已超人类,但作为评估者仍不可靠
最新研究测试了Anthropic Claude Opus 4.5、OpenAI GPT 5.2 Pro和Google Gemini 3 Flash在可视化评估上的能力。使用修改后的VLAT测试,发现这三款模型的可视化素养均超过人类平均水平。但在指令遵循方面,few-shot和chain-of-thought提示技术对提升可视化素养已无明显效果。在识别误导性可视化时,无专门提示下模型准确率偏低。结论认为LLM作为可视化评估者的能力仍需重新审视。
当前结论
这篇论文测了Claude、GPT和Gemini最新版,看图能力比人强,但让它们判断图表有没有骗人,还是不行。有意思的发现。
11 个信源44° AI 热度最后更新 2026/6/13 05:54:01
证据链
相关来源 1lmarena.ai
查看原文相关来源 2Artificial Analysis
查看原文相关来源 3Decoder
查看原文相关来源 4AI Will
查看原文相关来源 5歸藏(guizang.ai)
查看原文相关来源 6rohanpaul_ai
查看原文相关来源 7berryxia
查看原文相关来源 8Claude Code: GitHub Releases
查看原文相关来源 9Dylan Patel (SemiAnalysis)
查看原文相关来源 10Cognition
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。