Salesforce 的新论文 CLIFT,31B 开源模型打网页任务居然赢了 Gemini 3 Flash,关键是部署时不用裁判模型,省成本。
#Gemini 3 Flash
共 12 条 · 7 天 2 条 · 30 天 4 条
信息流里打上「Gemini 3 Flash」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
Salesforce CLIFT 方法让 31B Gemma-4 网页智能体在 WebArena 超过 Gemini 3 Flash
10月4日
Meta 等机构新论文:分支化自我改进的 Agent Harness 优化
Meta 和 Duke 的论文把 agent harness 自动调优拆成专精分支再加路由,Olympiad 数学准确率从 46% 拉到 62%,做 agent 自动调优的可以看看。
10月2日
9月28日
AgentWorld 基准发布:测试多智能体长程协作能力
一个新的多智能体协作基准,用 MMORPG 沙盒逼模型跑 50 多轮团队任务,Gemini 3 Flash 也只拿到 52% 成功率,能看清现在模型协作到底差在哪。
9月3日
8月9日
文档解析评测:Gemini 3 Flash最强,但前沿模型视觉能力原地踏步
Jerry Liu说别急着用前沿模型做文档OCR,LlamaParse在表格图表上准确率涨了15%,还能自己搭ParseBench跑评测。
7月27日
Google发布JAXBench:文档优化使Gemini 3 Flash正确率从5.8%升至37.3%
Google的新研究发现,给模型喂对TPU文档,比堆参数管用。JAXBench测50个真实负载,结果很实在。
7月22日
Gemini 3.5 Flash-Lite 发布,在智能体和编程基准上超越 3 Flash
Google 刚出的 Gemini 3.5 Flash-Lite 在智能体和编程上比 3 Flash 还强,现在 Gemini App 和搜索里就能用,API 也开放了,赶紧试试。
7月2日
论文10:12
比较GPT-5 mini、Gemini 3 Flash和DeepSeek Chat在Scrum认证题上的准确率与错误模式想了解GPT-5 mini、Gemini 3 Flash、DeepSeek Chat谁更适合Scrum考试?这篇论文用993道真题实测了准确率和稳定性,还分析了典型错误原因。
6月15日
5月20日
5月16日
Gemini 3 Flash 成为 Vercel AI Gateway 使用量领先模型
对于关注 AI 模型选型和成本优化的开发者,Gemini 3 Flash 的领先使用量意味着它可能是当前性价比最高的选择之一,值得在项目中尝试。