8月12日
18:01
18:01官方账号arXiv cs.AI@Girma Yohannis Bade, Olga Kolesnikova, Jose Luis Oropeza, Grigori Sidorov
该研究针对社交媒体政治话语,设计并评估了基于XGBoost和BERT的两种多类情感分析模型。在标注的政治社交媒体帖子数据集上,XGBoost模型测试集F1分数为0.2835,BERT模型为0.2806。结果显示政治话语情感分类的复杂性,为未来多类政治情感分析提供基线。
推荐理由:想了解政治文本情感分类的难度?这篇论文用XGBoost和BERT实测,F1都不到0.3,看看数据有多难搞。
17:56
17:56官方一手arXiv: OpenAI@Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma
arXiv新论文提出两阶段框架,针对医疗假设验证的选择题场景,仅在模型不确定时进行本体论接地,管理覆盖率与准确率的权衡。实验显示,弃权并非随机,而是反映真实不确定性,弃权预测的置信度较低。在GPT-5.5和DeepSeek-R1两个前沿模型上,该框架将问题级准确率从82.9%提升至92.5%,提升9.6个百分点;假设级准确率从92.0%提升至96.2%,提升4.2个百分点。在MedReason和MedQA基准上的实验表明,弃权可作为选择性推理精修的控制信号,无需显式构建知识图谱即可达到图谱级性能。
推荐理由:这篇论文教你怎么用弃权信号做推理精修,不用建知识图谱,医疗问答准确率直接涨9.6个点,GPT-5.5和DeepSeek-R1都试过。
17:51
17:51官方账号arXiv cs.AI@Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle, Anil Ramakrishna, Anubrata Das, Apurv Verma, Jwala Dhamala, Ninareh Mehrabi, Tharindu Kumarage, Yada Pruksachatkun, Yang Trista Cao, Kai-Wei Chang, Aram Galstyan
TrustNLP研讨会自2021年起与ACL系列会议联办,论文数从8篇增至41篇,六届共144篇。综述按六类信任维度分类,发现2025-2026年真实性主题占37%,公平性最稳定,可解释性呈U型回升。与ACL等约2000篇论文对比,TrustNLP主题分布接近领域平均水平。
推荐理由:想快速了解NLP信任研究六年的演变脉络,看这篇综述就够了,它把144篇论文的规律都总结好了。
17:49
17:49官方账号arXiv cs.AI@Nicola Giuseppe Marchioro, Gabriele Padovani, Amal Gueroudji, Rafael Ferreira da Silva, Wesley Brewer, Valentine Anantharaj, Sandro Fiore, Renan Souza
Workflow Cards是一种新文档形式,将工作流执行的机器可读溯源数据压缩为人类和LLM可读的结构化摘要。论文定义了基于溯源问题集的Workflow Card模板,并评估LLM使用其理解工作流执行的效果。结果显示,Workflow Cards提供了Model Cards和Data Cards缺失的执行级信息,填补了文档空白。与基于schema的查询相比,Workflow Cards在LLM-as-a-Judge和人工评估中答案质量几乎翻倍。
推荐理由:论文提出Workflow Cards,把工作流执行记录变成人和AI都能读的摘要,比直接查数据库答案质量高一倍,做AI文档的可以看看。
17:45
17:45AI Will@FinanceYF5
AI Agent在电脑操作基准测试中的成绩一年内从42%提升至85%,超过约72%的人类基准。这些Agent已从演示阶段进入真实业务场景。企业关注的重点已从Agent能否点击按钮,转向其能否稳定完成整份工作。
推荐理由:AI Agent操作电脑的成绩一年翻倍,已经超过七成人类,现在开始进企业干整份活了,看看它们到底行不行。
17:33
17:33官方账号阿里通义 Qwen@Alibaba_Qwen
精选
Qwen3.8-Max在Legal Research Bench上的得分在不到三个月内几乎翻倍,排名从第22位跃升至第4位。Vals AI在推文中强调了这一进步,并附上了相关链接。该模型在基准测试中的显著提升展示了其在法律研究领域的性能增强。
推荐理由:Qwen3.8-Max在Legal Research Bench上从第22冲到第4,三个月内得分翻倍,看看它怎么做到的。
17:12
17:12Yangyi@Yangyixxxx
安全研究人员发现OpenAI、Anthropic、Google等主要AI提供商的API存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话后,发现62个API密钥、33个邮箱和33个密码。该漏洞影响Claude、GPT等推理模型的隐私保护机制。
事件专题

推荐理由:安全研究员发现API漏洞能偷看Claude、GPT的加密思考过程,还扫出62个密钥,搞AI开发的得看看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。