11:43Gary Marcus@GaryMarcus75°Gary Marcus在推文中称,2017年以来除规模扩展外,最大突破是将基础模型扩展为整合工具和代码解释器的系统,例如Claude Code。João Mendonça则反驳,LLM领域已有9年没有突破,自2017年6月《Attention Is All You Need》和2017年1月应用稀疏MoE之后,架构没有质变。这场辩论的双方都承认,Claude Code是工具化系统路线的代表产品。AI模型Claude Code智能体Transformer推荐理由:Gary说最大突破是模型加工具和代码解释器,像Claude Code;另有人说9年没真突破。原文稍后读已读值得跟进有用关注 Claude Code
11:13lmarena.ai@lmarena_ai精选Qwen3.8-Max在Frontend Code Arena以1668分位列第四,仅次于Claude Opus 5 (Max)的1705分和Kimi K3 (Max)的1676分。该模型参数达2.4T,支持自主编码、多模态感知和长程规划,官方称可完成500+轮芯片设计优化。API定价为输入2.0美元/百万tokens,输出6.0美元/百万tokens,隐式缓存0.25美元/百万tokens。Alibaba Qwen表示下周将开放Qwen3.8-Max及Qwen3.8-27B的权重。AI模型Qwen3.8-MaxAlibaba_QwenFrontend Code Arena推荐理由:阿里的Qwen3.8-Max刚发布,前端代码榜排第四,分数紧咬Claude和Kimi,下周还开源权重,可以蹲一下。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
11:11lmarena.ai@lmarena_aiQwen3.8-Max在Vision Arena基准中排名第二,获得1305分。榜首是Claude Fable 5(High),领先优势仅13分。这一差距表明两者在视觉任务上的表现非常接近。AI模型Qwen3.8-MaxVision ArenaClaude Fable 51 个信源在谈事件专题推荐理由:Qwen3.8-Max在视觉榜单冲到第二,只比Claude Fable 5低13分,想看看国产视觉模型底子的可以关注。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
10:30Binyuan Hui@huyberyAndrej Karpathy用《指环王》第一段测试Opus 5,给它约1M token的预算(约10美元)并要求生成three.js渲染版本。Opus 5花了大约2小时写出5500行代码,程序化渲染了故事,但效果有些粗糙。Karpathy认为这类超定制世界生成是LLM的新应用场景,同时暴露了模型无法高效观看视频或玩游戏的短板,只能靠截图慢慢检查。AI模型Opus 5Karpathythree.js5 个信源在谈事件专题推荐理由:Karpathy用《指环王》首段测Opus 5,1M token生成5500行three.js代码,效果糙但脑洞大。原文稍后读已读值得跟进有用关注 Opus 5
10:17小互@imxiaohu85°OpenAI发布公告和200多页论文,披露下一代主力模型Astra的内部版本解决了10个数学与理论计算机科学难题。这些难题中最古老的来自1964年,最年轻的也已有二十多年未解,分布在八个分支。Astra尚未对外发布,目前仅以内部版本完成解题。AI模型OpenAIAstra推理模型10 个信源在谈事件专题推荐理由:OpenAI下一代模型Astra的论文:一口气解开10个几十年没人动的数学难题,想看看多强可点开。原文稍后读已读值得跟进有用关注 OpenAI
07:21Gary Marcus@GaryMarcus82°Gary Marcus在X上列出外界对OpenAI Astra数学结果的八种误解。他认为数学领域擅长验证与合成数据,因此Astra的数学能力不代表通用智能,并援引IBM Watson从问答转向医疗失败的例子。Astra的证明写作水平不及证明本身,也未必能可靠处理PDF提取或写视频脚本。Marcus还驳斥了Astra即奇点的说法,并称一次Fable运行不足以证明数学史被改写。AI模型AstraOpenAI数学推理10 个信源在谈事件专题推荐理由:Gary Marcus盘点Astra数学8大误区,冷静看待OpenAI新模型,别被'数学已解决'带偏原文稍后读已读值得跟进有用关注 Astra
06:08Gary Marcus@GaryMarcus79°Gary Marcus 发文指出,OpenAI 的 Astra 在数学上的成功并不代表通用能力。数学依赖符号验证和合成数据,容易刷分,但现实世界无法模拟。Astra 只擅长某些数学题,并非全领域领先,其证明写作能力也不及题目求解。他质疑 Astra 能解决 PDF 数字提取等现有模型难题。Marcus 强调,Astra 不是奇点,也不意味着自动化科学发现时代到来。AI模型OpenAIAstraGary Marcus10 个信源在谈事件专题推荐理由:Gary Marcus 给 OpenAI 的数学成绩单泼冷水:Astra 能解数学题是因为数学能自动验证,换到现实问题就不好说。别急着吹成万能。原文稍后读已读值得跟进有用关注 OpenAI
04:35HeyGen@HeyGen_OfficialHeyGen 用同一提示词测试了四个图像模型的身份保持能力,包括 Flux 2.0 pro、Seedream V5、Kling V3 等。Flux 2.0 pro、Seedream V5、Kling V3 各自生成了相似的脸,但都与目标真人不符。HeyGen 强调自家虚拟形象基于真实视频素材训练,这正是与这些模型的关键差别。AI模型HeyGenFlux 2.0 proSeedream V5推荐理由:HeyGen 用同一提示词测了四个模型,生成的脸像但非本人。和自家基于真实录像的虚拟形象一比,差距明显。原文稍后读已读值得跟进有用关注 HeyGen
22:08Hailuo AI@Hailuo_AIMiniMax H3 在用户 Farhan 的测试中生成了完整的游戏风格电影片段,场景包含古代水神庙、发光神器、巨石守卫和逃跑序列。整个片段中角色外观、镜头运动、水面光照、动作和音频保持了跨镜头一致,没有出现角色突变或环境崩坏。Farhan 认为它虽有小瑕疵,但已比随机生成的 AI 片段更接近真正的游戏过场动画。AI模型MiniMax H3Hailuo AI视频生成7 个信源在谈事件专题推荐理由:Farhan 用 MiniMax H3 做了一段水神庙逃生的游戏过场,角色、镜头、音效全程没崩,比单图生成靠谱多了。原文稍后读已读值得跟进有用关注 MiniMax H3
15:36小互@imxiaohu根据ArtificialAnlys的测算报告,DeepSeek完成相同基准任务的成本比Fable低105倍。这意味着DeepSeek的推理开销约为Fable的1/105。该对比数据来自ArtificialAnlys发布的模型成本分析。AI模型DeepSeekFableArtificialAnlys推荐理由:同一基准,DeepSeek成本只要Fable的1/105,这数字挺离谱的,可以点进去看看。原文稍后读已读值得跟进有用关注 DeepSeek
14:11Hailuo AI@Hailuo_AI创作者 @ponzponz15 用 MiniMax H3 测试绿幕编辑。他上传了原视频、编辑后视频和参考图像,验证 H3 能否在保持相机运动与人物位置的同时,将背景和服装替换为参考图像的世界观。测试结果显示,编辑后的画面在部分场景中轮廓反而更清晰。H3 支持参考图像转换、相机运动测试和时间一致性。AI模型MiniMax H3视频编辑多模态7 个信源在谈事件专题推荐理由:海螺AI官方转发了用户用MiniMax H3做绿幕编辑的测试,换背景和衣服还能保持镜头和人物不动,编辑后轮廓还更清楚,挺有意思。原文稍后读已读值得跟进有用关注 MiniMax H3
14:10宝玉@dotey精选Andrej Karpathy 用《指环王》第一段做测试,给 Opus 5 提供 100 万 token 预算(约 10 美元)和 three.js 渲染任务。Opus 5 用约 2 小时写了 5500 行代码,程序化生成故事场景,结果有点粗糙但能跑。Karpathy 认为 LLM 目前无法直接观看视频或玩游戏,只能靠截屏检查效果,因此出错不少。他设想按需生成'临时版 GTA'式的定制 3D 世界。AI模型Opus 5three.js3D渲染5 个信源在谈事件专题推荐理由:Karpathy 让 Opus 5 花 10 美元做了个《指环王》3D 渲染,5500 行代码,还聊了模型短板。原文稍后读已读值得跟进有用关注 Opus 5
13:08Geek@geekbb在包含940道题的Extended NYT Connections基准上,DeepSeek V4 Flash取得89.6分,位列第一。Gemini 3.6 Flash以89.0分紧随其后。Qwen 3.7 Plus的成绩为74.8分,Gemini 3.5 Flash-Lite为60.4分。Qwen 3.7 Flash和Qwen3.6-35B-A3B分别只拿到43.8和41.6分。AI模型DeepSeek V4 FlashGemini 3.6 FlashQwen 3.7 Plus10 个信源在谈事件专题推荐理由:DeepSeek V4 Flash在谜题基准拿到89.6,赢了Gemini 3.6的89.0,推理表现很亮眼。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
12:14官方一手歸藏(guizang.ai)@op741885°Karpathy加入Anthropic后首次发布长帖,给Opus 5约100万Token(约10美元)预算,让它用three.js渲染《指环王》故事。Opus 5耗时约2小时,写出5500行代码,最终生成一个3D版本。Karpathy指出,模型无法直接观看或游玩生成的视频/游戏,只能靠逐段截图检查,过程中出错多次。他认为多模态感知与游戏内交互能力仍是LLM明显的短板。AI模型Opus 5AnthropicKarpathy7 个信源在谈事件专题推荐理由:Karpathy给Opus 5百万Token预算,让它做《指环王》3D渲染,还吐槽模型没法自己看结果。原文稍后读已读值得跟进有用关注 Opus 5
11:09官方一手歸藏(guizang.ai)@op7418精选73°DeepSeek V4 Flash 正式版已上线官方 API,模型结构与 preview 版一致,仅重新做了后训练。官方公布的 Agent 基准成绩全面超过 V4 Pro Preview,其中 Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Cybergym 76.7。新版本兼容 Codex API 格式,并提供 Mac 和 Windows 一键配置脚本。AI模型DeepSeekV4 FlashV4 Pro推荐理由:DeepSeek 正式版 V4 Flash 的 Agent 跑分全面超过 V4 Pro Preview,还支持 Codex API 格式,一键脚本就能接入。原文稍后读已读值得跟进有用关注 DeepSeek
10:02Gary Marcus@GaryMarcus76°Gary Marcus发帖质疑,把AGI限定在可形式化领域是移动球门柱。他以2024年与Brundage的赌约为据,认为写视频脚本这类任务AGI应当能做。他承认Astra在数学上表现惊艳,但仅凭数学能力不足以证明其达到AGI。AI模型Gary MarcusAstra通用人工智能7 个信源在谈事件专题推荐理由:看了这条你会明白,Astra数学再强也不是AGI的充分证据,Gary Marcus一句话点破通用性该有的样子。原文稍后读已读值得跟进有用关注 Gary Marcus
08:44ollama@ollamaDeepSeek-V4-Flash-0731已在Ollama云上线,速度比前一天快2倍以上。该版本显著增强了智能体能力,支持通过ollama run deepseek-v4-flash:0731-cloud调用。用户还可搭配Claude Code使用,命令为ollama launch claude --model deepseek-v4-flash:0731-cloud。AI模型DeepSeek-V4-Flash-0731OllamaClaude Code推荐理由:Ollama云上线了DeepSeek-V4-Flash-0731,速度比昨天快2倍多,还能配合Claude Code用,可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
06:56Aravind Srinivas@AravSrinivas75°DeepSeek发布V4-Flash模型,据Artificial Analysis称,其完成与Fable 5相同的基准任务时,总成本仅为后者的1/105。这一成本差距达到两个数量级,属于罕见的效率提升。评论者将此次发布称为DeepSeek的2.0时刻,认为Flash版本将引发市场关注。AI模型DeepSeekV4-FlashFable 53 个信源在谈事件专题推荐理由:DeepSeek V4-Flash跑同样任务,总成本比Fable 5低了105倍,两个数量级的差距,真有点吓人。原文稍后读已读值得跟进有用关注 DeepSeek
06:26Gary Marcus@GaryMarcus精选Gary Marcus发推称,他猜测Astra是一个带辅助框架和工具的神经符号LLM。他强调这一观点与自己最初的说法一致,并质疑Astra是纯大模型的可能性。这条推文目前获得9595次查看和7个点赞。AI模型Astra神经符号Gary Marcus7 个信源在谈事件专题推荐理由:Gary Marcus公开赌Astra不是纯大模型,而是神经符号路线,还说自己早这么说了。想看他凭什么这么判断,就来读读这条。原文稍后读已读值得跟进有用关注 Astra
06:09elvis@omarsar0omarsar0在推文中称,DeepSeek V4-Flash等模型的token效率被低估,建议更激进地尝试不同测试框架。他提醒,DeepSeek V4-Flash的每token价格虽便宜,但多轮交互可能使单任务总成本更高。@ArtificialAnlys报告称,DeepSeek完成与Fable相同的基准任务时,总成本仅为Fable的1/105。AI模型DeepSeek V4-FlashFabletoken效率10 个信源在谈事件专题推荐理由:别光看每token单价:DeepSeek V4-Flash跑同基准总成本比Fable低105倍,这条推文有数据。原文稍后读已读值得跟进有用关注 DeepSeek V4-Flash
05:14Gary Marcus@GaryMarcus78°Gary Marcus在X上批评,OpenAI新证明引发的欢呼有数千万观看,而一位数学博士研究生对疑似反例的讨论互动数不足12次。他引用自己的帖子指出,至少一个Astra证明可能出错,该帖子有3249次观看,但只有5条回复、3次转发和14个赞。Marcus用这个对比说明,证明的验证过程未得到足够关注。AI模型OpenAIAstraGary Marcus10 个信源在谈事件专题推荐理由:Gary Marcus扒出OpenAI的Astra证明可能有问题,一个数学博士生的反例讨论才十几个互动,和数千万播放反差太大,建议去看看。原文稍后读已读值得跟进有用关注 OpenAI
02:09elvis@omarsar0DeepSeek-V4-Flash-High在Frontend Code Arena基准测试中获得1586分。该模型定价为每百万tokens输入0.14美元、输出0.28美元。官方称它是同类模型中性能价格比最高的选择。有开发者实测后表示,其前端代码能力超出预期,甚至怀疑自己用错了模型。AI模型DeepSeek-V4-Flash-HighDeepSeekFrontend Code Arena推荐理由:DeepSeek的新模型前端代码拿了1586分,定价才0.14/0.28美元,同类里性价比最高,前端开发者可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-High
01:38andrew chen@andrewchen精选MiaAI实验室用Hermes agent根据一条X帖子,在一夜之间自动完成了DeepSeek v4 Flash GA (0731)在2块NVIDIA DGX Sparks上的部署。部署使用官方FP8权重,单流推理速度达82 tok/s,峰值约95 tok/s,三会话并发时达到135 tok/s。该方案已发布在GitHub上,并感谢了0xSero提交的PR,后续还会改进部署配方。AI模型DeepSeek v4 FlashHermesNVIDIA DGX Sparks10 个信源在谈事件专题推荐理由:Hermes agent看了条帖子就自动部署好DeepSeek v4 Flash,双DGX Sparks跑出82 tok/s,省人力还快。原文稍后读已读值得跟进有用关注 DeepSeek v4 Flash
01:37Gary Marcus@GaryMarcusGary Marcus在X上表示,OpenAI的Dean Ball称Astra能做任何事,但他怀疑Astra连数学都未必擅长。Ben Horne将Noam的推文输入Claude,Claude最后总结称,列表中的内容几乎都是构造或显式边界,只需展示巧妙对象即可验证。Claude还指出,所有这些成果都没有涉及构建新理论。Gary Marcus认为这些突破虽然惊人,但缺乏新理论值得思考。AI模型OpenAIAstraClaude10 个信源在谈事件专题推荐理由:Gary Marcus怼Astra全能论,还用Claude分析Noam推文,看看AI圈怎么吵的原文稍后读已读值得跟进有用关注 OpenAI
01:35andrew chen@andrewchenDeepSeek V4 Flash 0731 被 Andrew Chen 安装到两台 DGX Spark 上。他在 X 平台晒出安装截图,表示将用于周末测试。目前该模型还没有官方基准分数,性能未知。AI模型DeepSeek V4 FlashDGX SparkDeepSeek10 个信源在谈事件专题推荐理由:哥们 Andrew Chen 晒了 DeepSeek V4 Flash 0731 跑在双 DGX Spark 上,想围观新版本性能的可以关注他。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
01:16elvis@omarsar082°OpenAI研究员Sebastien Bubeck表示,Astra是OpenAI下一个主要模型,已独立证明多个数学难题。OpenAI将发布10个Astra证明,每个都附带完整Lean证书和思维链(CoT)推演。结果包括对von Neumann代数中Connes刚性猜想的反驳,以及高维球堆积、电路复杂度、多色图中单色三角形的更好界限。这一进展让独立研究者对AI驱动的科学发现感到兴奋。AI模型AstraOpenAI数学证明10 个信源在谈事件专题推荐理由:OpenAI的Astra模型一口气放出10个数学证明,还带Lean验证和推理过程,数学爱好者可以围观了。原文稍后读已读值得跟进有用关注 Astra
01:08lmarena.ai@lmarena_ai精选Code Arena 公布 Image-to-WebDev 最新评测分数。Opus 5 (Max) 以 1669 分排名第一。GPT-5.6 的 Sol、Terra、Luna 三个版本分别拿到 1581、1531、1497 分,排在第 4、13、21 位。Grok-4.5 以 1578 分排第 5,Kimi K3 (Max) 以 1571 分排第 6,Muse Spark 1.1 以 1550 分排第 8。该评测考察模型根据截图生成网站,以及多步推理和工具调用的智能体编码流程。AI模型Opus 5GPT-5.6Code Arena4 个信源在谈事件专题推荐理由:想找能照着截图做网页的模型?直接看 Code Arena 这份榜单,Opus 5 (Max) 第一,GPT-5.6 和 Grok 的分数也都列出来了。原文稍后读已读值得跟进有用关注 Opus 5
01:06Kevin Weil@kevinweil78°OpenAI 官网发布 Ten Advances in AI Reasoning 页面,公开十项推理评估结果。首席产品官 Kevin Weil 在 X 上转发,称每项结果都是领域内的重要进展。他祝贺 Sebastien Bubeck、Mark Chen 等团队,并展望全球用户都能用上该模型。页面可用来对比当前推理模型的评测表现。AI模型OpenAI推理模型基准测试10 个信源在谈事件专题推荐理由:OpenAI把十个推理基准成绩一次性亮出来,Kevin Weil说是领域级结果。想了解新模型强在哪,直接翻这份榜单。原文稍后读已读值得跟进有用关注 OpenAI
00:21官方一手歸藏(guizang.ai)@op741882°OpenAI在X平台预热下一代模型Astra,称其解决了10个存在至少十年的数学问题。OpenAI研究负责人Sebastien Bubeck确认,Astra完成了多项成果,包括推翻Connes刚性猜想、改进高维球堆积和电路复杂性的界。这些证明将附带Lean证书和思维链(CoT)逐步讲解,并以论文形式发布。据称整个求解过程的算力成本仅约2000美元,OpenAI CEO Sam Altman已赴华盛顿与美政府沟通发布事宜。AI模型OpenAIAstra数学推理10 个信源在谈事件专题推荐理由:OpenAI说新模型Astra用2000美元算力解了10个老数学难题,连数学家都难搞定,还附Lean证明,感觉是真翻身了。原文稍后读已读值得跟进有用关注 OpenAI
23:08Gary Marcus@GaryMarcus74°Gary Marcus对OpenAI Astra的演示表示惊艳,但指出数学问题与其他问题不同,更适合形式化验证和合成数据。他认为该模型在开放式真实世界任务中的可靠性尚未可知,且未知是否依赖Lean等正式工具。Marcus质疑目前缺少具体实验细节,例如尝试了多少问题、成功多少,也没有独立验证。他提醒,过去社区多次对未亲测模型狂热,随后出现分歧或失望。AI模型OpenAIAstraGary Marcus10 个信源在谈事件专题推荐理由:Gary Marcus说:Astra数学成绩亮眼,但实际可靠性没验证,别急着嗨。原文稍后读已读值得跟进有用关注 OpenAI
17:08AI Will@FinanceYF5用户用旧版“对话式卡路里追踪器”提示词测试 Claude Opus 5,第一版就生成了完整应用。Claude Opus 5 的界面、交互与完成度超出预期,演示视频展示其实际效果。测试者据此怀疑,Opus 5 做移动应用可能已经强于 Fable。AI模型Claude Opus 5Fable移动应用推荐理由:有人拿旧提示词让 Claude Opus 5 做个卡路里追踪器,第一版就挺完整,感觉比 Fable 还顺。原文稍后读已读值得跟进有用关注 Claude Opus 5
15:59官方账号Greg Brockman@gdb76°OpenAI下一代模型Astra的内部版本解决了10个数学与理论计算机科学问题,总成本约2000美元。官方发布了10个Astra证明,每个都附带Lean证书和思维链走查。成果包括反驳Connes刚性猜想、改进高维球堆积界限、给出电路复杂度新界限,并确认nonsofic群存在。另外还改进了多色图中单色三角形的界限。AI模型AstraOpenAILean10 个信源在谈事件专题推荐理由:OpenAI的Astra模型花约2000美元解出10个数学难题,证明还带Lean验证,硬核得让人服气。原文稍后读已读值得跟进有用关注 Astra
14:32ollama@ollamaDeepSeek-V4-Flash-0731 已上线 Ollama 云服务。此次更新显著增强了模型在智能体任务中的表现。用户可运行 ollama run deepseek-v4-flash:0731-cloud 直接使用,也可通过 ollama launch claude --model deepseek-v4-flash:0731-cloud 将其与 Claude Code 集成。AI模型DeepSeek-V4-Flash-0731OllamaClaude Code推荐理由:DeepSeek-V4-Flash-0731 上架 Ollama 云了,agent 能力更强,能直接配合 Claude Code 用,跑一条命令就能体验。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
11:35小互@imxiaohu78°DeepSeek-V4-Flash正式版发布,官方声称可原生接入OpenAI Codex。该模型在九项Agent测试中全部反超自家更大的V4-Pro预览版。它登顶开源模型前三,输出价格比Opus 4.8便宜89倍。DeepSeek还为Codex做了官方适配,提供一条命令接入方案。AI模型DeepSeekV4-FlashCodex10 个信源在谈事件专题推荐理由:DeepSeek新出的V4-Flash能直接配Codex,一条命令搞定,跑分还反超自家V4-Pro,价格比Opus 4.8便宜89倍。原文稍后读已读值得跟进有用关注 DeepSeek
11:12shao__meng@shao__meng华为在 Hugging Face 发布 openPangu-2.0-Pro 的开源权重。官方称这是首个完全在昇腾 NPU 上训练的 500B+ 级模型,MoE 总参数量 505B、激活 18B,上下文 512K。在少量有交集的基准上,GPQA-Diamond 87.9,低于 Kimi K3 的 93.5 和 GLM-5.2 的 91.2;SWE-bench Verified 68.5,与 DeepSeek V3.1 的 66.0 接近。其 BrowseComp 65.7 也明显落后于 Kimi K3 的 91.2。AI模型openPangu-2.0-Pro华为昇腾8 个信源在谈事件专题推荐理由:华为开源 openPangu-2.0-Pro(505B/512K,昇腾训练),但 GPQA 87.9 不如 Kimi K3。原文稍后读已读值得跟进有用关注 openPangu-2.0-Pro
10:53Justine Moore@venturetwins一位用户过去一年半用同一图灵测试提示词试遍了 AI 视频模型,无一成功。MiniMax 3 成为首个通过该测试的模型,能在黑板上写出"Hi"。该模型由 Hailuo AI 团队发布,已开源。这标志着视频生成模型在指令遵循和文字书写能力上的显著进展。AI模型MiniMax 3Hailuo AI视频生成推荐理由:MiniMax 3 居然能真在黑板上写 Hi,之前所有视频模型都做不到,还开源了,快去试试。原文稍后读已读值得跟进有用关注 MiniMax 3
10:13Fireworks AI@FireworksAI_HQ72°DeepSeek-V4-Flash-0731已在Fireworks平台上线,支持日零部署。DeepSeek报告该模型在全部9项智能体评测中超越V4 Pro,其中Terminal Bench得分82.7%。其性价比优于V4 Pro,定价为每百万tokens 0.28美元,上下文窗口达100万tokens。AI模型DeepSeekV4-Flash-0731Fireworks推荐理由:Fireworks当天上线了DeepSeek最新模型,智能体评测全面超过V4 Pro,价格还更便宜,适合跑高并发任务。原文稍后读已读值得跟进有用关注 DeepSeek
09:48lmarena.ai@lmarena_ai精选DeepSeek-V4-Flash-High在Frontend Code Arena中取得1586分,总排名第7。它在开源模型中位列第3,消费者产品类目排名第4。参考设计、数据与分析、游戏类目均排第6,品牌与营销类目排第7。相比DeepSeek-V4-Flash-High-Preview提升154分,相比DeepSeek-V4-Pro-Preview提升121分。该模型定价为每百万token输入0.14美元、输出0.28美元,是同级别中性能价格比最高的。AI模型DeepSeek-V4-Flash-HighFrontend Code ArenaDeepSeek推荐理由:DeepSeek-V4-Flash-High跑前端代码榜第7、开源第3,价格0.14美元/百万token,同级别性价比最高。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-High
09:47lmarena.ai@lmarena_ai72°DeepSeek-V4-Flash-High在Frontend Code Arena中得分1586,刷新了帕累托前沿。其API定价为每百万token 0.14/0.28美元,是同级别中性能价格比最高的模型。DeepSeek-V4-Flash官方API已进入公开测试阶段,Agent能力大幅升级,基准成绩全面超过V4-Pro-Preview。该模型原生支持Responses API格式,并已适配Codex。AI模型DeepSeek-V4-FlashFrontend Code Arena编程助手10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的API放出来了,1586分的代码能力只要白菜价,还支持Codex,写前端的时候可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
09:25Geek@geekbb72°Hugging Face 通过 Inference Endpoints 部署了 DeepSeek-V4-Flash-0731 的免费公共端点,调用 OpenAI 兼容接口 /v1/chat/completions。模型名填 deepseek-ai/DeepSeek-V4-Flash-0731,api_key 填任意非空字符串即可。限流规则为每 IP 约 20 请求突发,之后约 12 请求/分钟补充,超限返回 429。发布者提醒并行 agent 调用没问题,但别做脚本轰炸。AI模型DeepSeek-V4-Flash-0731Hugging Face智能体10 个信源在谈事件专题推荐理由:Hugging Face 免费开放了 DeepSeek-V4-Flash-0731 接口,无需 token,随手就能调,适合测试 agent 并行调用。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731