8月21日
16:18
8月20日
01:55
01:55Gary Marcus@GaryMarcus
OpenAI 发布了 GPT - 5 模型,该模型在 MMLU 基准测试中取得了 2098 分的成绩,超过了上一代模型的记录,成为当前行业领先水平,专家表示其多领域任务处理能力显著提升。
事件专题

推荐理由:OpenAI 发了 GPT - 5 模型,能处理各种复杂任务,和之前模型比分数更高,适合需要高质量输出的场景。
8月13日
22:48
22:48小互@imxiaohu
76°
欧洲研究团队在8月10日发表论文,成功读取Anthropic、OpenAI、Google三家旗舰模型的隐藏推理链。团队从6708份公开AI会话日志中提取出62把真实API密钥。研究指出加密算法本身未被攻破,问题出在API设计上。
事件专题

推荐理由:欧洲团队破解了三大AI的加密思维链,还从公开日志里翻出62把API密钥,看完你就知道API设计有多危险。
8月9日
11:31
11:31官方一手歸藏(guizang.ai)@op7418
起因是一名用户按OpenAI指导在Cloud Code里使用GPT模型,账号随即被封。该用户在反馈中询问Anthropic的Boris,OpenAI的Tibo也加入争论。Boris邀请Tibo去Anthropic,Tibo拒绝并重置了Codex的限制。有人认为周末重置是表演性质,Tibo回应周一还有一次重置。
事件专题

推荐理由:OpenAI和Anthropic的人为个被封号的事吵起来,Tibo直接重置了Codex限制,周一还有动作,挺戏剧性。
7月29日
18:38
11:10
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman
该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。
推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。
7月27日
7月24日
09:21
09:21官方一手arXiv: DeepSeek@Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis, Derek Enodolomwanyi
一篇论文评估了GPT和DeepSeek在符号安全协议分析中的能力,使用130个混淆的AnB/AnBx协议涵盖388个安全目标,与ProVerif和OFMC工具对比。Chat模式召回率69%-81%,但精确率低于31%。推理模式将GPT精确率提升至66.5%,DeepSeek至45.4%,但仅检测到一半以上攻击。在保密性目标上,推理模式F1达到95.7%。各模型在认证目标上表现最差,且判断不稳定。
推荐理由:这篇论文用具体数据告诉你,GPT和DeepSeek在形式化验证上还比不上ProVerif这些专业工具,但推理模式能把精确率拉到66%,可能当个预筛选过滤器。
08:19
08:19岚叔@lufzzliz
用户在微博提到GPT Voice功能尚未完全开放,但发现一个更实用的更新:创建项目时支持添加多个文件夹。这个功能省去了向Codex额外指定目录的步骤。对于多模块项目,该改动能提升编程效率,减少重复操作。
推荐理由:哥们,Codex更新了:建项目能加多个文件夹了,再也不用每次都手动说‘参考xx目录’,省事不少!
7月23日
11:27
11:27官方账号arXiv cs.AI@Seongmin Kim, Abhinav Rijal, Yuri Alexeev, Nora Bauer, Martin Roetteler, Mina Yoon, George Siopsis, In-Saeng Suh
DQAOA-GPT是一种混合框架,将分布式量子近似优化算法(DQAOA)与GPT生成模型结合,用于求解组合优化问题。该方法将大规模优化问题分解为子问题,用训练好的生成模型直接产出高质量量子电路,避免传统迭代优化。在多达100个决策变量的密集HUBO问题上,DQAOA-GPT相比常规DQAOA显著降低计算成本,同时保持接近的解质量。子问题规模越大,加速效果越明显。
推荐理由:这篇论文把GPT和量子优化搭在一起,搞了个DQAOA-GPT框架,算大型组合问题比传统方法快很多,成本也低,值得看看思路。
7月22日
11:24
11:24官方一手arXiv: DeepSeek@Yin Wu, Yixuan Liu, Yi Li, Chenyang Peng, Hao Wu, Ming Fan, Ting Liu, Haijun Wang
论文系统化分析了ERC-20代币合约中隐蔽陷阱的分类,提出基于代币功能生命周期的分类法。TrapHunter框架结合抽象行为树(ABT)与增强路径图(APG)统一语义表示,利用LLM推理行为意图偏差,并通过分叉动态验证确认可攻击性。在269份真实合约上使用DeepSeek、GPT和Gemini三种LLM进行测试,平均精确率81.8%,召回率85.4%,显著优于现有工具。
推荐理由:想防智能合约陷阱?这篇论文把隐蔽代币合约的六类套路全解剖了,用三种大模型验证,精确率81.8%,比现有工具强一截。
7月20日
14:52
7月9日
02:38
7月7日
01:09
01:09官方账号NVIDIA AI@NVIDIAAI
精选
这篇ICML论文区分了大型语言模型的非预期记忆与泛化,并估计GPT风格模型容量约为每参数3.6比特。该结果为数据、扩展和隐私推理提供了更精确的视角。研究者通过实验方法量化了模型记忆边界。

推荐理由:NVIDIA发了篇ICML论文,算出每个参数只能记住3.6比特,帮你理解模型记性边界和隐私风险。
7月3日
04:01
04:01The Rundown AI@therundownai
精选
Mira Murati的Thinking Machines Lab与全球最大对冲基金Bridgewater合作,测试AI用于投资新闻筛选。GPT、Claude、Gemini在六项过滤测试中平均准确率约50%。专家投资者编写提示词后准确率升至74-76%,但仍低于80%的信任阈值。通过TML的Tinker API微调开放权重模型,准确率达到84.7%,错误率比最佳前沿模型降低29.8%,且每任务成本仅为前者的1/13.8。
事件专题

推荐理由:Mira Murati团队和桥水基金一起搞了个AI筛选新闻的实验,先用GPT、Claude只有50%准确率,专家写提示词到75%还是不够,最后微调模型干到了84.7%,成本还低了13倍多。