事件专题 · 官方一手

LLM可视化素养已超人类,但作为评估者仍不可靠

最新研究测试了Anthropic Claude Opus 4.5、OpenAI GPT 5.2 Pro和Google Gemini 3 Flash在可视化评估上的能力。使用修改后的VLAT测试,发现这三款模型的可视化素养均超过人类平均水平。但在指令遵循方面,few-shot和chain-of-thought提示技术对提升可视化素养已无明显效果。在识别误导性可视化时,无专门提示下模型准确率偏低。结论认为LLM作为可视化评估者的能力仍需重新审视。

当前结论

这篇论文测了Claude、GPT和Gemini最新版,看图能力比人强,但让它们判断图表有没有骗人,还是不行。有意思的发现。

11 个信源44° AI 热度最后更新 2026/6/13 05:54:01

证据链

相关来源 2Artificial Analysis
查看原文
相关来源 5歸藏(guizang.ai)
查看原文
相关来源 8Claude Code: GitHub Releases
查看原文
相关来源 9Dylan Patel (SemiAnalysis)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情