09:21官方一手arXiv: DeepSeek@Qunhui Zhang论文提出VirtualSet,一种接收者类型化的本体世界接口,替代SQL作为LLM的生成目标。在BIRD基准测试的1072题子集上,VirtualSet配合deepseek-reasoner达到67.5%准确率,比带修复和投票的SQL高4.0个百分点(p=0.00117)。系统通过通用约束投影(GCP)在表达式执行前检查,并利用集合链保留具体接收者类型将无效字段转为类型错误。在30个受控决策用例中,写入链拦截了20/20的幻觉动作体且无假阳性。论文VirtualSetBIRDdeepseek-reasoner推荐理由:用VirtualSet替代SQL,让LLM查询出错时提前报类型错误而不是给假结果,BIRD上还比SQL高4个点,很适合做安全决策。原文稍后读已读值得跟进有用关注 VirtualSet
11:26官方一手arXiv: DeepSeek@Qunhui ZhangVirtualSet提出将LLM的生成目标从SQL替换为类型化的set expressions,通过Generic Constraint Projection在执行前检测类型错误。在BIRD基准的1,072题测试集上,使用deepseek-reasoner模型,VirtualSet达到67.5%准确率,高于直接SQL的63.5%(McNemar exact p=0.00117)。在一个30个动作的防护测试中,VirtualSet成功拦截全部20个幻觉动作且零误报。该方法在保持SQL基准竞争力的同时,提供了写操作前的语义决策保障。AI模型VirtualSetdeepseek-reasonerBIRD1 个信源在谈事件专题推荐理由:VirtualSet让LLM不用冒SQL幻觉的风险,改天用类型安全的set表达式,BIRD上准确率反超4个百分点,写操作还能拦截瞎编的数据输入。原文稍后读已读值得跟进有用关注 VirtualSet
13:54IT之家(博客/媒体)精选Google Research 推出 Gemini-SQL2 模型,基于 Gemini 3.1 Pro 打造,专攻 Text-to-SQL 任务。在 BIRD 基准的单模型赛道中,执行准确率达 80.04%,超越此前 Gemini-SQL。BIRD 覆盖 95 个数据库、37 个领域和 12751 组问题,数据量 33.4GB,模拟真实企业环境。该模型可让业务人员用自然语言查询营收、流失等数据,但谷歌尚未公布 API 或接入产品。AI模型Gemini-SQL2Google ResearchText-to-SQL4 个信源在谈事件专题推荐理由:谷歌新模型让自然语言查数据库更准原文稍后读已读值得跟进有用关注 Gemini-SQL2
09:43官方一手marktechpost@Asif Razzaq精选Google Research 于 2026 年 6 月 12 日发布 Gemini-SQL2,基于 Gemini 3.1 Pro 模型。该模型在 BIRD 单模型排行榜上取得 80.04% 的执行准确率。文章解释了该分数含义、排行榜对比情况,以及 Google 未披露的细节。同时介绍了使用场景和基于 schema 的实现模式。AI模型Gemini-SQL2Gemini 3.1 ProBIRD3 个信源在谈事件专题推荐理由:Google 新模型 SQL 准确率破 80%原文稍后读已读值得跟进有用关注 Gemini-SQL2
04:21elvis@omarsar0精选Google Research 推出 Gemini-SQL2,基于 Gemini 3.1 Pro 模型。该模型在 BIRD 基准上实现了最新最佳结果,能够将自然语言转换为可直接执行的 SQL 查询。BIRD 是一个高难度的文本转SQL基准,Gemini-SQL2 在此验证了定制模型在处理复杂真实数据时的优势。AI模型Gemini-SQL2GoogleBIRD3 个信源在谈事件专题推荐理由:Google 用 Gemini 3.1 Pro 刷新了 SQL 生成最强成绩原文稍后读已读值得跟进有用关注 Gemini-SQL2