7月24日
16:54
16:34
16:34官方账号阿里云 Alibaba Cloud@alibaba_cloud
精选
阿里云发布Token Plan,用一个信用池整合Qwen、Wan、HappyHorse、DeepSeek和GLM等模型的使用费。用户只需为实际调用的token付费,无需管理多个订阅。该计划旨在简化AI工具成本管控,适用于企业和开发者。

推荐理由:阿里云搞了个Token Plan,把Qwen、Wan这些模型的花费统一到一个池子里,按实际用量扣钱,省去多个订阅的麻烦。
09:21
09:21官方一手arXiv: DeepSeek@Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis, Derek Enodolomwanyi
一篇论文评估了GPT和DeepSeek在符号安全协议分析中的能力,使用130个混淆的AnB/AnBx协议涵盖388个安全目标,与ProVerif和OFMC工具对比。Chat模式召回率69%-81%,但精确率低于31%。推理模式将GPT精确率提升至66.5%,DeepSeek至45.4%,但仅检测到一半以上攻击。在保密性目标上,推理模式F1达到95.7%。各模型在认证目标上表现最差,且判断不稳定。
推荐理由:这篇论文用具体数据告诉你,GPT和DeepSeek在形式化验证上还比不上ProVerif这些专业工具,但推理模式能把精确率拉到66%,可能当个预筛选过滤器。
7月23日
00:24
00:24官方一手歸藏(guizang.ai)@op7418
精选
Codepilot即将发布新版本,允许用户为每个SubAgent单独指定模型。例如,可用Grok检索Twitter内容,用DeepSeek生成文案,用Kimi K3生成网页。该功能让不同模型发挥各自特长,提升协作效率。
事件专题

推荐理由:以后一个任务里可以让Grok搜推、DeepSeek写稿、Kimi做页面,想怎么混搭都行。
7月22日
11:24
11:24官方一手arXiv: DeepSeek@Yin Wu, Yixuan Liu, Yi Li, Chenyang Peng, Hao Wu, Ming Fan, Ting Liu, Haijun Wang
论文系统化分析了ERC-20代币合约中隐蔽陷阱的分类,提出基于代币功能生命周期的分类法。TrapHunter框架结合抽象行为树(ABT)与增强路径图(APG)统一语义表示,利用LLM推理行为意图偏差,并通过分叉动态验证确认可攻击性。在269份真实合约上使用DeepSeek、GPT和Gemini三种LLM进行测试,平均精确率81.8%,召回率85.4%,显著优于现有工具。
推荐理由:想防智能合约陷阱?这篇论文把隐蔽代币合约的六类套路全解剖了,用三种大模型验证,精确率81.8%,比现有工具强一截。
11:22
11:22官方一手arXiv: DeepSeek@Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler
这篇论文通过两个案例研究分析了Claude和DeepSeek的四代模型在SWE-bench Lite上的非功能性质量差异。静态分析显示大多数CodeQL配对差异为零,且无CodeScene比较在Holm校正后显著。CPU时间差异较小且不一致,峰值内存略高但绝对差异很小。整体上,较晚模型解决更多实例,但在共同解决的任务中非功能性指标无一致改进。
推荐理由:这篇研究不只看模型能修复多少问题,还比较了Claude和DeepSeek不同代际的代码质量、CPU时间和内存使用,发现新模型虽修得多但代码质量没明显提升。
7月21日
7月18日
09:28
09:28官方一手pandaily@contact@pandaily.com (Pandaily)
76°
Moonshot AI将Kimi K3定价为每百万token 3-15美元,是此前K2.6价格的3-4倍。该定价为DeepSeek同类模型的3-15倍,成为当前中国最贵的大模型。此举标志着Moonshot AI从成本领先战略转向高价值复杂任务能力。国内计算生态系统的成熟为其提供支撑。
事件专题

推荐理由:Moonshot AI出了个超贵模型Kimi K3,比DeepSeek贵3-15倍,但专攻复杂任务,不是打价格战。
03:40
03:40官方账号Decoder@Matthias Bastian
73°
Moonshot AI 发布 Kimi K3 模型,初步评估表现匹配 Anthropic 的 Opus 4.8。该模型由仅 300 人团队开发,OpenAI 战略师 Dean W. Ball 评价其“非常好”。Ball 同时警告开源权重模型主导将导致“AI 共产主义”,重新引发关于算力重要性及美国出口管制有效性的讨论。
事件专题

推荐理由:Kimi K3 用 300 人就追上 Anthropic 顶配,OpenAI 的人还吐槽开源是 AI 共产主义,值得看算力是否真的重要。
7月17日
11:45
11:45官方一手pandaily@contact@pandaily.com (Pandaily)
DeepRoute.ai在2026北京车展上宣布从ADAS供应商转型为Physical AI基础设施构建商。该公司将统一基础模型、大规模真实世界数据以及前DeepSeek科学家Ruan Chong的加入作为其核心战略,全力押注AI在物理世界的应用。

推荐理由:DeepRoute.ai拉来DeepSeek的Ruan Chong,从智能驾驶转向物理AI基建,看看他们要怎么做。
11:22
11:22官方一手arXiv: DeepSeek@Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo
该研究分析了GPT-4o mini、DeepSeek和Claude在460个编程任务(Python和Java各230个)上的代码生成质量,将英文提示翻译并人工校订为中文、印地语、西班牙语和意大利语。通过测试通过率、代码度量标准和静态分析工具评估,发现英文提示并非总能产生最佳功能正确性或代码质量,提示语言的影响取决于编程语言和LLM,且生成的代码常在注释和字符串中混合英语与提示语言。这是首个用于研究代码生成中语言偏差的精选多语言基准。
推荐理由:想了解提示语言怎么影响代码生成质量?这篇实测了GPT-4o mini、DeepSeek和Claude在多种语言下的表现,结果英文不一定最好。
7月16日
15:16
15:15
11:32
11:32Ethan Mollick@emollick
Ethan Mollick评测新开源权重模型Inkling,指出其性能远不及DeepSeek R1等中国前沿开源模型。Inkling未能通过Lem测试,而该测试自DeepSeek R1/Sonnet 3.5以来已被所有前沿模型通过。Mollick认为Inkling目前还处于粗糙阶段。
事件专题

推荐理由:想看看新开源模型Inkling到底行不行?Ethan Mollick实测发现它连Lem测试都过不了,和DeepSeek R1差距明显。
7月15日