06:41官方账号Perplexity@perplexity_aiDeepSeek V4 Pro 现已在美国托管的 Perplexity Computer 中可用。Perplexity 在 WANDR 基准上对其进行了评估,得分为 0.359,每任务成本 0.75 美元。该模型比成本性能前沿上的下一个模型便宜 62%。AI产品DeepSeek V4 ProPerplexityWANDR1 个信源在谈事件专题推荐理由:Perplexity 把 DeepSeek V4 Pro 放进自家电脑了,跑分 0.359,每任务才 0.75 美元,比同档便宜六成多,性价比很能打。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
17:44官方一手歸藏(guizang.ai)@op7418精选CodePilot 适配了 Grok 4.6、DeepSeek V4 Pro 和 GLM 5.3 三款新模型。用户可以将 Grok 会员中的图像模型与视频模型额度直接用于 CodePilot。该工具还新增了 Twitter 检索功能。持有 Twitter 会员的用户,无需额外付费即可调用 Grok 的图像、视频生成及检索服务。AI产品CodePilotGrokDeepSeek V4 Pro4 个信源在谈事件专题推荐理由:CodePilot 现在能白嫖 Grok 的绘图和视频模型,只要有 Twitter 会员就行,还支持检索推文,挺划算的。原文稍后读已读值得跟进有用关注 CodePilot
12:12IT之家(博客/媒体)千问办公在首页「前沿模型」档位首发上线 GLM-5.3 和 DeepSeek V4 Pro 两款模型。DeepSeek V4 Pro 支持 100 万 token 上下文,最高 384K 输出,在长程任务与自动化任务基准上排名靠前。GLM-5.3 是智谱的开源旗舰模型,在不改变基座的情况下通过后训练 Scaling,相比 GLM-5.2 实现 50% 性能提升。千问办公由 QoderWork、MuleRun、悟空三款产品整合而来,个人标准版订阅价 78 元/月,个人高级版订阅价 158 元/月。AI产品千问办公GLM-5.3DeepSeek V4 Pro10 个信源在谈事件专题推荐理由:千问办公现在能直接用 GLM-5.3 和 DeepSeek V4 Pro,一个开源一个超长上下文,复杂任务和自动化工作流都能扛,想试试前沿模型可以直接上手。原文稍后读已读值得跟进有用关注 千问办公
14:32shao__meng@shao__meng精选GLM-5.3于本周正式发布,加入新一轮模型竞赛。同周内Grok 4.6和DeepSeek V4 Pro也已亮相。DeepSeek还推出了Harness工具,并上调了API价格。另外,Gemini 3.7 Flash也在本周被提及。AI模型GLM-5.3Grok 4.6DeepSeek V4 Pro10 个信源在谈事件专题推荐理由:GLM-5.3来了,这周还有Grok 4.6和DeepSeek V4 Pro,模型更新扎堆,看看哪个最强。原文稍后读已读值得跟进有用关注 GLM-5.3
12:27官方一手arXiv: DeepSeek@Xiangfeng Sun, Ceyu Xu, Ningzhi Ai, Zeyu Zhu, Yiyang Yuan, Yuan Xie74°论文提出一种性能异常驱动的自动研究流程,通过反复询问预取器失败原因,迭代构建混合预取器MoP。该流程消耗1.91亿DeepSeek V4 Pro tokens,并自动合成多个专用子预取器。在SPEC CPU2006和SPEC CPU2017上,MoP相比无预取实现61.1%的几何平均IPC加速。相比人类设计的Alecto、Berti和Pythia,MoP分别高出14.5%、21.6%和23.6%。RTL综合显示其占用110KB存储和0.0347平方毫米面积。论文MoPDeepSeek V4 Pro硬件预取10 个信源在谈事件专题推荐理由:这篇论文让AI Agent自己找预取器失败原因并造新方案,结果比人类设计的Alecto和Berti还强,值得看看。原文稍后读已读值得跟进有用关注 MoP
21:45小互@imxiaohu据X平台用户@xiaohu发布的推文,DeepSeek V4 Pro版本因发错被撤回重发。该推文目前有9024次浏览、20次点赞和10条转评。这则关于DeepSeek V4 Pro的传闻目前仅有单条消息来源,未见官方说明。AI模型DeepSeek V4 ProDeepSeekX10 个信源在谈事件专题推荐理由:DeepSeek疑似手滑发错V4 Pro版本又撤回,想知道V4 Pro真面目和官方反应的,可以关注后续。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
18:10向阳乔木@vista8DeepSeek V4 Pro在未开启思考模式下,按提示词“鹈鹕骑自行车svg,撞上大象,循环播放”生成动画。测试动画中鹈鹕骑自行车撞上大象并循环播放,说明模型能理解多物体交互和循环指令。该模型名为DeepSeek-V4-Pro-0813,百万tokens输入(缓存未命中)定价3元,输出定价6元,均高于DeepSeek Flash的1元和2元。其并发限制为500,低于DeepSeek Flash的2500。AI模型DeepSeekDeepSeek V4 Pro视频生成10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro不开思考模式就能按提示词生成鹈鹕撞大象的SVG动画,效果挺逗,价格和限流也都摸清了,来看看。原文稍后读已读值得跟进有用关注 DeepSeek
18:09官方一手歸藏(guizang.ai)@op7418精选OpenCode Go 已集成 DeepSeek V4 Pro,用户可在客户端中直接选用。此前 DeepSeek Flash 已有一周热度,现在 V4 Pro 也正式在 OpenCode Go 上线。打开 OpenCode Go 即可切换使用。AI产品OpenCode GoDeepSeek V4 ProDeepSeek Flash10 个信源在谈事件专题推荐理由:OpenCode Go 直接把 DeepSeek V4 Pro 放进客户端了,之前大家还在追 Flash,现在 V4 Pro 出来直接在 OpenCode Go 里用,想试新模型的朋友打开就能选。原文稍后读已读值得跟进有用关注 OpenCode Go
18:09官方一手歸藏(guizang.ai)@op7418DeepSeek V4 Pro 正式版 0813 发布。从流传的测试成绩来看,0813 的性能表现相当突出。目前官方尚未公布 0813 的完整基准数据。AI模型DeepSeekDeepSeek V4 Pro模型发布10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 0813 正式版来了,听说测试成绩很炸,想蹲实测的可以先围观。原文稍后读已读值得跟进有用关注 DeepSeek
18:06IT之家(博客/媒体)DeepSeek 发布 DeepSeek-V4-Pro-0813 正式版,API 同步上线更新。新版本增强了智能体能力,支持 Responses API 和 Codex 接入。在多项测试中,DeepSeek V4 Pro 正式版性能接近 Fable 5,相比预览版大幅提升。AI模型DeepSeek V4 Pro智能体Responses API10 个信源在谈事件专题推荐理由:DeepSeek 又发新版本了,V4 Pro 正式版 API 已上线,智能体能力更强,还支持 Codex,性能直逼 Fable 5。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
18:02爱范儿@莫崇宇DeepSeek V4 Pro 正式版发布。该模型在多项核心基准测试中接近 Fable 5 的水平。目前官方尚未公布具体评测数字。更多性能细节有待后续信息披露。AI模型DeepSeekDeepSeek V4 ProFable 510 个信源在谈事件专题推荐理由:DeepSeek 的新旗舰 V4 Pro 上线了,多项测试快赶上 Fable 5,关心模型性能的可以留意。原文稍后读已读值得跟进有用关注 DeepSeek
18:00官方一手歸藏(guizang.ai)@op741871°网传截图显示DeepSeek Harness将于今日开启公测,可能与DeepSeek V4 Pro正式版0813的模型细节一同发布。归藏转发了这一消息并引用相关截图,评论区讨论测试成绩依然相当爆炸。具体基准数字和完整评测尚未公开。AI产品DeepSeekDeepSeek V4 ProHarness10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 0813和Harness今天都有动静,想蹲一手最新测试成绩的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
17:55爱范儿@彭海星DeepSeek V4 Pro正式版发布,实测性能直逼Fable 5。DeepSeek V4 Pro在AI Agent方向上发力,还藏了一个大招。爱范儿实测显示,DeepSeek V4 Pro在智能体任务中表现抢眼。AI模型DeepSeek V4 ProDeepSeekFable 510 个信源在谈事件专题推荐理由:DeepSeek V4 Pro正式版来了,实测跟Fable 5有得一拼,还藏了个大招,想玩智能体的朋友可以看看。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
17:47向阳乔木@vista8一条推文将Grok 4.6、DeepSeek V4 Pro 0813、WeLM-617B和Qwen3.8-2.4T-A95B四个模型放在一起,问网友最想先测哪个。该推文目前已获得4980次浏览、19个赞和10条评论。除型号列表外,原文并未给出基准测试分数、发布时间等更多信息。AI模型Grok 4.6DeepSeek V4 ProWeLM-617B10 个信源在谈事件专题推荐理由:四个新模型突然一起出现,Grok、DeepSeek、WeLM、Qwen,你想先试哪个?原文稍后读已读值得跟进有用关注 Grok 4.6
17:46IT之家(博客/媒体)DeepSeek V4 Pro 正式版于8月13日晚间发布,已更新至API,调用模型名保持不变。新版本增强了Agent能力,支持Responses API和Codex接入。官方评测显示,DeepSeek-V4-Pro-0813在多项测试中接近Fable 5水平,相比预览版能力大幅提升。AI模型DeepSeekDeepSeek V4 Pro智能体10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 正式版来了,Agent 能力增强,支持 Codex 接入,跑分直逼 Fable 5,用 API 的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
17:46向阳乔木@vista8博主@vista8 用与DeepSeek V4 Pro相同的提示词测试Grok 4.6。在一个打砖块游戏中,Grok 4.6设计出带熔炉故事场景的情节,音效表现也可圈可点。该模型还一次生成了60种Bento样式风格,其中部分样式的视觉效果优于DeepSeek V4 Pro。AI模型Grok 4.6DeepSeek V4 ProBento样式10 个信源在谈事件专题推荐理由:有人用同一组提示词跑Grok 4.6和DeepSeek V4 Pro,Grok在打砖块场景和Bento样式上都很惊艳,部分比DS 4 Pro还好看。原文稍后读已读值得跟进有用关注 Grok 4.6
18:38官方一手arXiv: DeepSeek@Francisco León Zúñiga Bolívar一项研究比较了DeepSeek V4 Pro、Qwen3-Max、Kimi K2.5和GLM-5.1四个中国前沿模型在进化囚徒困境中的合作倾向。通过固定代码转换器为GPT-5.4 Mini,排除了编码能力干扰,发现各模型攻击性均衡比例从Qwen3-Max的1%到DeepSeek V4 Pro的9%不等。四个实验室间的差异(8个百分点)大于中国与西方生态系统的均值差异(5.0%对5.0%)。研究支持H6假设,即中国模型并非单一整体,实验室层面而非生态系统层面决定合作倾向。论文DeepSeek V4 ProQwen3-MaxKimi K2.54 个信源在谈事件专题推荐理由:想知道中国大模型是不是都一个样?这篇论文用囚徒困境测了DeepSeek、Qwen、Kimi和GLM,发现它们合作倾向差别挺大,别再把它们当铁板一块了。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
14:00Geek@geekbbX平台用户geekbb发帖吐槽,称GLM 5.3、Grok 4.6和DeepSeek V4 Pro正式版一直不发布。该帖获得7条评论、10个点赞和2338次浏览。网友猜测各家都在等对方先出招,互相观望。行业GLM 5.3Grok 4.6DeepSeek V4 Pro1 个信源在谈事件专题推荐理由:三大模型都吊着不发,这条帖子下面都在猜是不是互相等着背刺,2338次浏览看大家怎么催更。原文稍后读已读值得跟进有用关注 GLM 5.3
11:22官方一手arXiv: DeepSeek@Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin精选现有强化学习RL训练对话智能体时通常针对固定对手,导致策略利用对手特定规律,作者将其称为静态对手不匹配问题。为此提出的IB-RL让对话双方通过联合轨迹共同进化,但各自用独立优势、动作掩码和更新路径优化自身奖励。在Vehicle TeleSales任务上,IB-RL取得89.6%的Success@1,超过最优单边基线84.6%。在Deal-or-NoDeal任务中,IB-RL对DeepSeek V4 Pro达到98.4%的一致率,而最优单边基线仅86.4%。论文IB-RLDeepSeek V4 Pro强化学习3 个信源在谈事件专题推荐理由:IB-RL让对话双方独立对练,不靠固定对手。车销任务89.6% vs 基线84.6%,还胜过DeepSeek V4 Pro。原文稍后读已读值得跟进有用关注 IB-RL
00:23orange.ai@oran_geDeepSeek V4 Pro 的评测成绩比 Claude Fable 低 0.3%。网友认为这个差距很小,并把它和 DeepSeek 涨价联系起来。曹山石发布的内容提到 DeepSeek 正在新一轮融资。colaos.ai 的六倍 DeepSeek 额度也因涨价传闻引发讨论,用户希望涨幅小一些。AI模型DeepSeek V4 ProClaude FableDeepSeek4 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 跟 Claude Fable 只差 0.3%,又赶上新一轮融资,colaos.ai 的六倍 DeepSeek 额度还能撑多久真不好说。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
21:49OpenRouter@OpenRouterAIOpenRouter发布两个基于真实花费份额的任务排行榜。Shell执行任务中,DeepSeek V4 Pro排名第一。工具调度任务中,Kimi K3占据首位。两个榜单均由开放模型登顶。AI模型DeepSeek V4 ProKimi K3OpenRouter10 个信源在谈事件专题推荐理由:OpenRouter按真实花费给模型排名,DeepSeek V4 Pro拿下Shell执行第一,Kimi K3拿下工具调度第一,开放模型领先。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
23:55Geek@geekbb一条X推文猜测,DeepSeek V4 Pro发布后,厂商会不会继续推出DeepSeek V4 Ultra。该推文获得2条回复、1个点赞和1213次浏览。这条推文只讨论DeepSeek V4 Pro与V4 Ultra的命名关系,没有发布任何版本信息。行业DeepSeekDeepSeek V4 ProDeepSeek V4 Ultra1 个信源在谈事件专题推荐理由:geekbb在X上问:DeepSeek会不会再出V4 Ultra?虽然只是脑洞,但这条推文有1200多次浏览,好奇大家怎么看。原文稍后读已读值得跟进有用关注 DeepSeek
10:08Geek@geekbb精选一位开发者设想 DeepSeek Harness 采用双模型组合:DeepSeek V4 Pro 负责规划,DeepSeek V4 Flash 0731 负责执行。该用户表示,相比其他模型订阅费用,DeepSeek 的价格让人用得起。Tianyi Cui 在回复中招募 Agent Harness 相关开源项目的开发者参与内测,申请人需提供 GitHub id 和开源代表作。行业DeepSeekDeepSeek HarnessDeepSeek V4 Pro3 个信源在谈事件专题推荐理由:有人设想让 V4 Pro 规划、V4 Flash 执行,还招开源开发者内测 DeepSeek Harness,想玩 Agent 的可以关注。原文稍后读已读值得跟进有用关注 DeepSeek
07:02IT之家(博客/媒体)72°OpenAI于7月31日宣布下调GPT-5.6 Luna和GPT-5.6 Terra模型调用费用。Luna每百万Token输入从1美元降至0.2美元,降幅80%,输出从6美元降至1.2美元。Terra每百万Token输入从2.5美元降至2美元,降幅20%,输出从15美元降至12美元。在Artificial Analysis Intelligence Index v4.1中,Luna每任务费用低于DeepSeek V4 Pro,性能得分更高。AI产品OpenAIGPT-5.6 LunaGPT-5.6 Terra10 个信源在谈事件专题推荐理由:OpenAI把Luna模型价格砍到原来的五分之一,比DeepSeek V4 Pro还便宜,性能却更好,做任务的成本大幅降低。原文稍后读已读值得跟进有用关注 OpenAI
07:21官方账号Simon Willison’s Weblog(博客/媒体)Dylan Castillo针对AI实验室是否专门训练模型生成“骑自行车的鹈鹕”进行了系统测试。他设计了8种动物×6种车辆共48个提示,每个提示在7个模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro)上运行3次,并用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助评估。结果显示,没有任何模型在鹈鹕骑自行车场景上表现更好,GLM-5.2虽有微小正向偏差但统计不显著。结论是AI实验室并未系统性地优化这一特定组合。论文GPT-5.6ClaudeGLM-5.22 个信源在谈事件专题推荐理由:别猜了,Dylan用48个提示跑了7个模型,结论是AI实验室没作弊,鹈鹕骑自行车并不比其他组合强。原文稍后读已读值得跟进有用关注 GPT-5.6
21:37Paul Couvert@itsPaulAi73°阿里云发布 Qwen 3.8 max preview 开源权重模型,参数规模达 2.4T,官方称性能仅次于 Fable 5。该模型预览已通过阿里云平台开放,用户可选择起步价为每月 4 美元(首月优惠价)的套餐使用。同时平台还提供 GLM-5.2、DeepSeek V4 Pro 等模型的选项,并支持在 Claude Code、Hermes 等工具中调用。AI模型Qwen 3.8 max previewAlibabaGLM-5.24 个信源在谈事件专题推荐理由:阿里云发了个 2.4T 参数的开源模型 Qwen 3.8 max preview,性能接近 Fable 5,首月才 4 美元,还能在 Claude Code 里用,可以试试。原文稍后读已读值得跟进有用关注 Qwen 3.8 max preview
09:48官方一手marktechpost@Michal Sutter82°文章对三款开源万亿参数MoE模型Kimi K3、DeepSeek V4 Pro和GLM-5.2进行了全面对比。对比涵盖了在多项基准测试中的表现、采用的MIT或Modified MIT许可证以及实际服务成本。文章提供了这些模型在不同维度上的差异分析,帮助读者了解各模型的优劣势。AI模型Kimi K3DeepSeek V4 ProGLM-5.210 个信源在谈事件专题推荐理由:想选开源万亿模型?这篇直接拿三个主流模型比了基准、许可证和成本,看完就知道选哪个合适。原文稍后读已读值得跟进有用关注 Kimi K3
15:36AI Will@FinanceYF571°高盛报告指出,中国顶级编码模型GLM5.2和Qwen3.7 Max的每百万混合token成本约1美元,而美国SOTA模型为4-8美元。中国模型以低于成本价销售,高盛估计当前智能体模型EBIT利润率为-30%,编码模型为-39%,预计到2030年分别转为+14%和+22%。架构上,DeepSeek V4 Pro仅激活1.6T参数中的49B(<8%),GLM5.2激活744B中的40B,更低的FLOPs提供了价格下限。在OpenRouter上,中国模型按任务花费占比仅5-16%,但占据了85%的智能体token和89%的编码token。基准SDLLMTK从6月初约2.07降至当前1.67。行业GLM5.2Qwen3.7 MaxDeepSeek V4 Pro2 个信源在谈事件专题推荐理由:高盛给LLM经济学算了笔账:中国模型靠架构优势把价格打到美国1/4,但还在亏本卖。想搞清模型定价走势的可以看。原文稍后读已读值得跟进有用关注 GLM5.2
14:50IT之家(博客/媒体)精选Artificial Analysis 新增 6 个行业指数测试,Claude Fable 5 在全部 8 项指标中排名第一。Claude Opus 4.8 六项第二,GPT-5.5 xhigh 拿下剩余两项第二。开放权重模型 GLM-5.2 在 5 个行业指数中领先,工程基准得 53 分。成本方面,Claude Fable 5 在战略与运营指数中每任务成本 3.48 美元,是 DeepSeek V4 Pro max(0.03 美元)的 116 倍,性能仅高 12 分。DeepSeek V4 Flash 成本低于 0.04 美元,得分处于中游。AI模型Claude Fable 5DeepSeek V4 ProGPT-5.510 个信源在谈事件专题推荐理由:想选行业AI模型?Claude Fable 5 碾压全场,但成本是 DeepSeek V4 Pro 的百倍,性能只多 12 分,性价比得掂量。原文稍后读已读值得跟进有用关注 Claude Fable 5
00:22官方账号Decoder@Matthias BastianAnthropic 的 Claude Fable 5 在 Artificial Analysis 发布的六个新行业基准(金融、法律、医学)中全部获得最高分。在 Strategy & Ops Index 中,Fable 5 单次任务成本 3.48 美元,是 DeepSeek V4 Pro 的 0.03 美元的 100 倍以上,但分数仅领先 12 分。这表明顶级推理性能以极高的使用成本为代价。AI模型Claude Fable 5AnthropicDeepSeek V4 Pro10 个信源在谈事件专题推荐理由:Claude 5 性能确实最强,但用一次要三块多,比 DeepSeek 贵百倍,分数只高一点,性价比要好好掂量。原文稍后读已读值得跟进有用关注 Claude Fable 5
16:26官方一手pandaily@contact@pandaily.com (Pandaily)精选腾讯发布Hunyuan Hy3,一个295B参数的MoE架构模型,其中21B为活跃参数。该模型在Agent任务中达到90%的解决率,超越DeepSeek V4 Pro和Qwen 3.7 Max。它在多个关键基准上表现领先。AI模型Hunyuan Hy3TencentDeepSeek V4 Pro1 个信源在谈事件专题推荐理由:腾讯新出的Hunyuan Hy3,Agent任务解决率90%,直接超过DeepSeek和Qwen,搞智能体的话一定要看看。原文稍后读已读值得跟进有用关注 Hunyuan Hy3
10:04Viking@vikingmute精选Mitchell Hashimoto分享了使用Fable xhigh作为规划/架构师、GPT 5.5 xhigh作为编码员、再让Fable xhigh审查的工作流。每次规划和审查成本仅需几美元,远低于通常的50美元以上。另有用户尝试廉价方案:GPT5.5规划+DeepSeek V4 Pro编码+composer2.5/GPT5.5交叉审查。GPT 5.5 xhigh收费比Fable便宜且速度很快。技巧FableGPT 5.5DeepSeek V4 Pro1 个信源在谈事件专题推荐理由:Mitchell Hashimoto分享的核心方案:Fable xhigh规划+GPT 5.5 xhigh编码+Fable xhigh审查,成本低至几美元。想省钱的可以用DeepSeek V4 Pro代替编码步骤。原文稍后读已读值得跟进有用关注 Fable
18:34官方账号Together AI@togethercomputeTogether AI 部署的 DeepSeek V4 Pro 在 Artificial Analysis 基准测试中同时获得输出速度和延迟两项第一。该成绩通过优化 KV 缓存、前缀复用、内核及端点配置实现。Together AI 公开了其推理系统的具体工程方案,包括缓存策略和内核调优。AI模型DeepSeek V4 ProTogether AIArtificial Analysis1 个信源在谈事件专题推荐理由:Together AI 把 DeepSeek V4 Pro 调到了速度与延迟双第一,还公开了优化方法,搞推理部署的值得看看。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
13:11官方账号LMSYS Org (SGLang)@lmsysorg精选73°SGLang在NVIDIA GB300 NVL72平台上,针对DeepSeek V4 Pro 1.6T模型(FP4精度,8K/1K上下文)实现了每GPU超过12K tok/s的推理速度。该性能由NVIDIA Dynamo(SGLang)和MTP技术协同实现。根据SemiAnalysis InferenceX基准测试,该性能在整个交互性曲线上保持稳定。AI模型SGLangGB300 NVL72DeepSeek V4 Pro10 个信源在谈事件专题推荐理由:SGLang在GB300上跑DeepSeek V4 Pro,每GPU超1.2万token原文稍后读已读值得跟进有用关注 SGLang
16:04IT之家(博客/媒体)精选安全研究员Kasra Rahjerdi搭建了一个故意留有漏洞的图书评论APK,测试多款AI大语言模型的安全推理能力。模型需解包APK并识别暴露的Firebase凭据以绕过API访问数据库。每个模型预算10美元,限时2小时,总花费1500美元。结果显示,GPT-5.5在10次运行中成功7次,每次成功成本9.46美元;DeepSeek V4 Pro成功3次,但每次成功成本仅0.62美元,约为GPT-5.5的十五分之一。Gemini多次在任务早期拒绝继续,而Claude Sonnet 4.6和Opus 4.8各成功2次。该测试揭示了不同模型在安全漏洞利用任务中的性能与成本差异,对批量运行安全工具的团队具有现实意义。AI模型安全测试GPT-5.5DeepSeek V4 Pro推荐理由:安全团队和AI开发者可以直观看到不同模型在真实漏洞利用任务中的性价比——GPT-5.5最可靠但贵,DeepSeek V4 Pro成本极低但成功率有限,做自动化安全测试的团队值得参考这个对比。原文稍后读已读值得跟进有用关注 安全测试
02:21官方账号Cohere@cohere精选Cohere 发布 Command A+,在非拉丁语系语言测试中表现突出。在韩语、日语、希伯来语、中文和阿拉伯语上均超越 Mistral Medium 3.5。尤其在阿拉伯语上,Command A+ 比 Mistral Medium 3.5 高 5 个百分点,比 DeepSeek V4 Pro Sovereign AI 高 10 个百分点。AI模型Command A+Mistral Medium 3.5DeepSeek V4 Pro1 个信源在谈事件专题推荐理由:非拉丁语表现更优原文稍后读已读值得跟进有用关注 Command A+