06:05官方账号Allen AI (Ai2)@allen_aiAllen AI 构建的 SciArena 基准测试用于评估 AI 模型处理科学文献问题的能力,评判者均为研究人员。该基准将于 7 月 15 日退役,最终数据包括约 1700 名用户投出的约 3900 次投票。结果揭示了模型在科学问答、文献理解等任务上的表现对比。具体排名和用户偏好信息已在推文线程中公布。AI模型SciArenaAllen AI科学文献推荐理由:Allen AI 用研究者投票测了 AI 的科学文献能力,1700 人投了 3900 票,想看看哪个模型更靠谱?这里直接给结果。原文稍后读已读值得跟进有用关注 SciArena
05:58Justine Moore@venturetwins九日前,有人让多个 LLM 预测 2022 年世界杯冠军。Fable 是唯一预测法国队会被淘汰的模型,并正确猜中阿根廷和法国两支决赛队伍。ChatGPT、Qwen 和 Kimi 各猜对了一个决赛选手。该测试展示不同模型在体育赛事预测方面的能力差异。AI模型FableChatGPTQwen推荐理由:Fable 比 ChatGPT 和 Qwen 更准,竟然独自猜对了法国翻车和决赛阵容,挺有意思的对比。原文稍后读已读值得跟进有用关注 Fable
05:46官方账号Fei-Fei Li@drfeifei精选Stanford SVL与NVIDIA Robotics联合提出RoboTTT,基于测试时训练(TTT)方法,将机器人模型原生扩展到8000时间步的上下文(约5分钟肌肉记忆),推理成本恒定。相比以往机器人策略仅能处理数帧(<0.1秒),该方法将上下文长度提升3个数量级。在电路板组装任务中,RoboTTT通过一次人类视频演示即可实现零样本模仿学习。实验显示,8K上下文预训练性能比1K高出62%,且从128到8K时间步的闭合环路性能持续提升无饱和迹象。AI模型RoboTTTStanford SVLNVIDIA10 个信源在谈事件专题推荐理由:斯坦福和英伟达搞了个新方法RoboTTT,能让机器人记住5分钟内的动作历史,一次看人演示就能模仿,还能自己纠错。上下文越长效果越好,8K比1K强62%。原文稍后读已读值得跟进有用关注 RoboTTT
05:39岚叔@lufzzliz82°xAI 将 Grok Build 开源,用户可获取其源代码。同时,Grok 的使用额度被重置,用户可重新使用。其 Agent 功能受到部分用户喜爱。AI模型GrokxAI开源模型推荐理由:xAI 把 Grok 的构建代码放出来了,还重置了额度,想玩 Agent 的可以试试。原文稍后读已读值得跟进有用关注 Grok
05:27官方账号OpenAI@OpenAIOpenAI展示了GPT-Live模型的改进,该模型能保持对话连续性,同时处理多个任务,例如查询航班信息、获取当地天气和实时制定行程。官方演示中可见其多任务并发处理能力。这一更新在Twitter上获得广泛关注,拥有超过260次点赞和46k次观看。AI模型GPT-LiveOpenAI多任务10 个信源在谈事件专题推荐理由:OpenAI的GPT-Live现在能一边聊天一边帮你查航班、天气和做行程,多任务处理更流畅了。原文稍后读已读值得跟进有用关注 GPT-Live
04:27lmarena.ai@lmarena_ai精选Thinking Machines 发布 Inkling,支持文本、图像和音频三种模态。Inkling 已加入 Agent Arena,该基准使用数百万全球用户的长时任务评估智能体,任务涉及网络搜索、文件系统和终端操作。Inkling 也参与文本、视觉和代码竞技场。Inkling 完整权重开放,可在 Tinker 平台进行微调。AI模型InklingThinking MachinesAgent Arena10 个信源在谈事件专题推荐理由:Thinking Machines 出了个新模型 Inkling,能同时处理文字、图片和音频,还在 Agent Arena 上测了长期任务能力。现在能免费下载权重自己微调,可以试试。原文稍后读已读值得跟进有用关注 Inkling
03:57The Rundown AI@therundownai精选Thinking Machines 推出了其首个模型 Inkling,这是一个开源权重的多模态系统。Inkling 拥有高达 100 万 token 的上下文窗口,能够原生处理文本、图像和音频,并支持可控思考努力。完整权重已在 Hugging Face 上公开,并可通过 Tinker 平台进行微调。团队表示 Inkling 不是整体最强的模型,但专为定制化而设计。AI模型Thinking MachinesInkling多模态10 个信源在谈事件专题推荐理由:想找个能处理百万 token 多模态、还能自己微调的开源模型?Inkling 刚上线,权重直接开放,值得试试。原文稍后读已读值得跟进有用关注 Thinking Machines
03:54官方账号Greg Brockman@gdb精选73°OpenAI发布GPT-Red,一种内部自动化红队测试工具,专注于大规模发现模型的提示注入漏洞。该工具帮助OpenAI在模型广泛部署前建立更强防御。GPT-Red通过模拟攻击自动检测提示注入风险,提升模型安全性。OpenAI利用该工具在正式发布前修复漏洞,降低安全威胁。AI模型OpenAIGPT-Red提示注入10 个信源在谈事件专题推荐理由:OpenAI搞了个自动红队GPT-Red,专门找自家模型的提示注入漏洞,部署前先修好,安全又可靠。原文稍后读已读值得跟进有用关注 OpenAI
03:51官方账号Greg Brockman@gdb用户称GPT-5.6 Sol是迄今为止最令人印象深刻的模型。在编程之外的数学和视觉能力方面,Sol(Max)表现极佳。测试显示Sol和Terra在视觉数学上远优于其他模型。这些改进非常显著。AI模型GPT-5.6 SolOpenAI多模态10 个信源在谈事件专题推荐理由:有人实测了GPT-5.6 Sol,数学和视觉超强,比Terra和其他模型厉害很多,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:46Suhail@Suhail精选Thinking Machines 今日推出多模态模型 Inkling,支持文本、图像和音频三种模态的高效推理。该模型完全权重开放,允许用户在 Tinker 平台上进行微调。官方同时提供 Inkling Playground 供用户体验。这一发布标志着后训练基础设施即服务的垂直整合进入新阶段。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Inkling 能同时处理文本、图像和音频,权重全开放还能自己微调,去 Playground 玩一把就知道了。原文稍后读已读值得跟进有用关注 Inkling
03:42Paul Couvert@itsPaulAiThinking Machines发布了开源模型Inkling,采用Apache 2.0许可。Inkling为多模态模型,支持文本、图像和音频,拥有41B活跃参数。在Design Arena上其性能与GPT-5.6 Sol相当。公司还计划推出12B参数的Inkling-Small版本。Inkling提供完整权重,并可在Tinker平台微调。AI模型InklingThinking MachinesGPT-5.6 Sol10 个信源在谈事件专题推荐理由:Thinking Machines出了个真开源的多模态模型Inkling,41B参数能和GPT-5.6 Sol掰手腕,还准备出12B小版,赶紧试试。原文稍后读已读值得跟进有用关注 Inkling
03:40elvis@omarsar0精选Thinking Machines推出Inkling,一个975B参数(41B活跃)的MoE Transformer模型。它原生支持文本、图像和音频多模态处理。上下文长度提供64K和256K两种版本。完整权重已开放,可在Tinker平台进行微调。用户还能通过Inkling Playground直接体验。AI模型InklingThinking MachinesMoE10 个信源在谈事件专题推荐理由:Thinking Machines开源了975B参数的MoE模型Inkling,支持多模态和64K/256K长上下文,还能在Tinker上微调,值得试试。原文稍后读已读值得跟进有用关注 Inkling
03:39Lilian Weng@lilianwengThinking Machines 发布 Inkling 模型,提供完整开源权重。该模型在文本、图像、音频三种模态上均具备高效推理能力。用户可在 Tinker 平台上直接进行微调。基准性能覆盖广泛能力类别,适合实际应用与定制开发。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Thinking Machines 开源了 Inkling,能同时处理文本、图像和音频,还能在 Tinker 上微调,挺实用的。原文稍后读已读值得跟进有用关注 Inkling
03:13lmarena.ai@lmarena_ai中国开源权重模型Kimi K3已在lmarena平台以'KIVINE'名称上线,官方发布在即。该模型由AI创作者进行初步测试,展示了包括赛车游戏在内的多个基准结果。Kimi K3在Hugging Face和lmarena上的表现吸引了社区关注,具体基准分数尚未完整公布。AI模型Kimi K3KIVINElmarena10 个信源在谈事件专题推荐理由:Kimi K3是国产开源新秀,已经在lmarena上跑分了,代号KIVINE,想看看它和开源模型比怎么样?原文稍后读已读值得跟进有用关注 Kimi K3
03:02官方账号vLLM@vllm_project84°Thinking Machines Lab发布了TML Inkling,一个1T参数的开源权重模型,支持文本、图像和音频多模态输入。其上下文窗口高达100万token,采用相对注意力、短卷积和MoE专家汇聚的新架构,并配备8个MTP头用于推测解码。vLLM已从首日支持该模型,在NVIDIA Blackwell和Hopper上运行,4×GB200 MTP可达380 tok/s/user。AI模型TML InklingThinking Machines LabvLLM10 个信源在谈事件专题推荐理由:1T参数的开源多模态模型,百万token上下文,vLLM直接跑,4×GB200飙到380 tok/s,值得试试。原文稍后读已读值得跟进有用关注 TML Inkling
03:00官方账号NVIDIA AI@NVIDIAAI精选Thinking Machines 推出开源模型 Inkling,支持文本、图像和音频三模态推理。模型基于 NVIDIA GB300 NVL72 训练,NVFP4 检查点已在 Hugging Face 开放下载。官方提供完整权重,并支持通过 Tinker 平台进行微调,用户也可在 Inkling Playground 直接体验。AI模型InklingThinking MachinesNVIDIA10 个信源在谈事件专题推荐理由:Thinking Machines 刚发了 Inkling,一个开源的多模态推理模型,能处理文本、图像、音频,还给了完整权重可以微调,NVFP4 检查点直接下。原文稍后读已读值得跟进有用关注 Inkling
02:56elvis@omarsar073°OpenAI 发布了内部自动化红队工具 GPT-Red,用于大规模发现模型中的提示注入漏洞。GPT-Red 对 GPT-5.6 进行了对抗性训练,显著增强了其对抗提示注入的鲁棒性。该方法以高投资回报率提升了 AI 模型的安全性,帮助在更广泛部署前构建更强防御。AI模型GPT-RedGPT-5.6OpenAI10 个信源在谈事件专题推荐理由:OpenAI 用 GPT-Red 对抗训练 GPT-5.6,让模型更抗提示注入,安全提升很实在。原文稍后读已读值得跟进有用关注 GPT-Red
01:56lmarena.ai@lmarena_aiArena团队推出新的事实性信号方法,用于测量模型是否生成真实且可验证的声明。该方法分析了前沿模型在事实性上的表现差异,揭示了模型在真实世界可靠性中的关键指标。目前该评测尚未公开具体模型得分,但提供了新的评估维度。AI模型Arenafactuality模型评估推荐理由:Arena团队搞了个新方法测模型真假话,比基准靠谱,想知道你的模型有多爱吹牛?看点这个。原文稍后读已读值得跟进有用关注 Arena
01:16Justine Moore@venturetwinsBytePlus 展示其最新 AI 视频生成模型 Seedance 2.5,用其重现已退役足球明星 Michael Owen 职业生涯的经典时刻。该模型能生成高质量、连贯的视频片段,几乎可用于所有常见视频创作场景。如果公开版本保持同样水准,AI 生成视频将在更多实际用例中取代传统制作。AI模型Seedance 2.5BytePlus视频生成推荐理由:BytePlus 的 Seedance 2.5 把 AI 视频生成又推了一大步,连足球名将的巅峰动作都能还原,效果非常逼真。原文稍后读已读值得跟进有用关注 Seedance 2.5
00:43lmarena.ai@lmarena_ai精选Arena 推出基于人类偏好和事实性加权组合的新排名。系统随机抽取对战并提取网络可验证声明,已标注超 200 万条声明(Text Arena 130 万+,Search Arena 70 万+)。启用事实性后,Claude Fable 5 降至第 2,GPT-5.5 跃升 13 位至第 7,Muse Spark 跌 13 位至第 20。Meta 整体排名从第 2 跌至第 5,Anthropic 仍居榜首,开源模型中 Xiaomi 从第 9 升至第 6。AI模型Arena事实性Claude Fable 510 个信源在谈事件专题推荐理由:以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。原文稍后读已读值得跟进有用关注 Arena
00:42lmarena.ai@lmarena_ai在 Search Arena 最新事实性排行榜中,GPT-5.5-search 上升一位,占据榜首。GPT-5.2-search 排名大幅提升,从第11位跃升至第3位。Claude-sonnet-4-6-search 从第6位跌至第9位,Gemini-3.1-pro-grounding 从第7位降至第13位。该排行榜基于事实性指标对搜索模型进行排序。AI模型GPT-5.5-searchGPT-5.2-searchclaude-sonnet-4-6-search推荐理由:看谁家搜索模型最靠谱?GPT-5.5-search 刚拿了事实性第一,GPT-5.2-search 飙升到第三,Claude 和 Gemini 反而掉了。原文稍后读已读值得跟进有用关注 GPT-5.5-search
23:55elvis@omarsar0精选Robbyant 开源了 LingBot-VLA 2.0 的训练后代码。在单张 NVIDIA GeForce RTX 4090D 上,仅需 10 步去噪,推理耗时约 130 毫秒。这意味着用户无需集群即可进行适配和测试,大幅降低了部署门槛。AI模型LingBot-VLA 2.0RobbyantRTX 4090D10 个信源在谈事件专题推荐理由:Robbyant 把 LingBot-VLA 2.0 的训练后代码开源了,单张 RTX 4090D 跑出 130 毫秒推理,不用集群就能自己玩。原文稍后读已读值得跟进有用关注 LingBot-VLA 2.0
23:52Jim Fan@DrJimFan76°研究团队推出RoboTTT模型,通过测试时训练(TTT)机制,将机器人策略的上下文窗口从不足0.1秒扩展到8000时间步(约5分钟),推理成本保持恒定。该模型在上下文长度上比现有SOTA提升了3个数量级。实验显示,从128到8000时间步,闭环性能持续提升,8K预训练比1K提升62%。RoboTTT支持从人类视频进行一次性上下文学习,并能在执行过程中自我纠正错误。AI模型RoboTTT机器人模型上下文学习2 个信源在谈事件专题推荐理由:机器人模型终于能记住5分钟内的动作了!RoboTTT用TTT方法让机器人从人类视频一次学会新任务,还能边干边自我纠错,性能随上下文增长持续提升。原文稍后读已读值得跟进有用关注 RoboTTT
23:24elvis@omarsar0LingBot-VLA 2.0 是全新开源具身模型,在单臂机器人到人形平台等多样化配置上训练。模型整合了60K小时精选机器人与人类数据,形成通用策略。在复杂长周期任务中显著提升机器人性能。由 @robbyant_brain 团队发布。AI模型LingBot-VLA 2.0开源模型具身智能推荐理由:开源、60K小时数据、覆盖多种机器人,LingBot-VLA 2.0 在长周期任务上表现出色,值得研究具身智能的你看一看。原文稍后读已读值得跟进有用关注 LingBot-VLA 2.0
23:09Viking@vikingmute用户测试发现,Codex执行更换图片地址的任务耗时超过6分钟仍未完成,而Composer2.5在同一任务中仅需几秒。这种速度差异导致使用体验显著下降。作者感叹用过快的模型后再用慢的会产生明显的挫败感。AI模型CodexComposer2.5编程助手推荐理由:Composer2.5换地址几秒搞定,Codex要等6分钟还不动,别用慢模型折磨自己。原文稍后读已读值得跟进有用关注 Codex
22:42Hailuo AI@Hailuo_AIElevenLabs推出Music v2,可从场景、风格和情绪提示生成任意类型音乐。Seed Audio 1.0支持从文本、参考音频或图像生成语音,并可调节速度、音量和音高。两个模型分别面向音乐和语音生成场景。AI模型ElevenLabsMusic v2Seed Audio 1.0推荐理由:ElevenLabs同时更新了音乐和语音生成模型,Music v2能从提示生成任何风格音乐,Seed Audio 1.0支持图片转语音,玩法更多了。原文稍后读已读值得跟进有用关注 ElevenLabs
22:20官方账号Together AI@togethercompute精选PrismML发布了Bonsai 27B,一个270亿参数的多模态模型,能在手机级设备上本地运行。该模型采用三元量化技术压缩体积,同时保留图像理解等多模态能力。用户现可通过Together AI平台在线试用。这是本地AI在参数量和设备适配上的重要进展。AI模型Bonsai 27BPrismMLTogether AI推荐理由:27B参数的多模态模型能塞进手机?Bonsai 27B做到了,性能还很强,快试试。原文稍后读已读值得跟进有用关注 Bonsai 27B
12:45Hunyuan@TXhunyuan腾讯混元发布了Hy3的1-bit和4-bit量化版本,该模型拥有295B参数。通过1-bit和4-bit量化,模型可在单张GPU上运行,大幅降低硬件门槛。支持使用llama.cpp进行推理,并启用MTP(多token预测)功能。模型以GGUF格式提供下载,用户可快速体验。AI模型Hy3TencentHunyuan量化模型推荐理由:腾讯把295B的模型压到1-bit和4-bit,单卡就能跑,用llama.cpp就能玩,赶快试试。原文稍后读已读值得跟进有用关注 Hy3
11:48小互@imxiaohuPrismML 基于 Qwen3.6-27B 模型,将原本 54GB 的 27B 参数模型压缩至 3.9–5.9GB,使其能在 iPhone 上运行。在 15 项测试中,5.9GB 的 Ternary 版本保留原版 95% 性能,3.9GB 的 1-bit 版本保留 90% 性能。在 RTX 5090 上推理速度达 163 token/s,在苹果 M5 Max 上达 87 token/s。AI模型Qwen3.6-27BPrismMLiPhone推荐理由:PrismML 把 27B 大模型压到几 GB 还能在手机上跑,性能几乎没缩水,iPhone 用户也能本地跑大模型了。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
10:38官方账号vLLM@vllm_project精选vLLM项目实现了预填充与解码分离,TileRT通过vLLM V1连接器将自身低延迟解码引擎与vLLM预填充配对,无需修改vLLM代码。原生vLLM解码默认用于吞吐场景,TileRT解码用于延迟敏感场景(如智能体、实时助手)。TileRT在GLM-5.1-FP8(8×B200)上单用户解码达618 tok/s,启用推测解码(MTP)后约为无MTP基线的2倍,峰值接近800 tok/s。AI模型vLLMTileRTGLM-5.1-FP8推荐理由:vLLM拆开预填充和解码,TileRT提供低延迟解码,单用户618 tok/s,适合实时助手。原文稍后读已读值得跟进有用关注 vLLM
09:09Suhail@SuhailPerplexity 开源了内部基准测试 WANDR,用于评估深度与广度研究能力。WANDR 在对比所有 Deep Research 类基准中表现最强,例如比 DRACO 更优秀。该基准测试已公开在 research.perplexity.ai/articles/wandr。AI模型PerplexityWANDR基准测试推荐理由:Perplexity 拿他们最强的内部测试 WANDR 开源了,专门测深度研究能力,比市面其他基准都强。原文稍后读已读值得跟进有用关注 Perplexity
08:53Paul Couvert@itsPaulAiPrismML今天推出Bonsai 27B,首个能在手机上运行的27B参数多模态模型。基于Qwen3.6 27B,提供两个变体:三元版5.9GB(1.71位/权重)和1-bit版3.9GB(1.125位/权重)。该模型支持多步推理、结构化工具使用和长上下文智能体循环。全部代码和权重已开源(Apache 2.0),此前运行类似模型需要千美元级电脑。AI模型Bonsai 27BPrismMLQwen3.6推荐理由:27B模型能塞进手机,3.9GB就跑得动,还完全开源。手机党不用再羡慕桌机了。原文稍后读已读值得跟进有用关注 Bonsai 27B
08:41berryxia@berryxia精选72°OpenMOSS 发布 MOSS-VL-Realtime,一个 11B 参数的多模态模型,支持实时视频流交互,可边接收视频边生成回复。采用 Cross-Attention 架构和 XRoPE 位置编码,支持 256K 上下文窗口,兼容文本、单图/多图、视频及图文交错输入。在流式视频理解基准上达到开源模型领先水平,主动预警和及时响应能力突出。同时开源 MOSS-VL-0708 Instruct,在细粒度感知和长视频理解任务上有明显提升。所有模型以 Apache-2.0 协议开源,支持本地部署和实时推理。AI模型OpenMOSSMOSS-VL-Realtime多模态推荐理由:OpenMOSS 发了能边看视频边聊天的实时多模态模型,11B 参数开源可部署,适合做监控、直播等持续视频理解应用。原文稍后读已读值得跟进有用关注 OpenMOSS
08:40berryxia@berryxia73°PrismML推出Bonsai 27B模型,可在iPhone 17 Pro上直接运行,内存占用低于5GB。这是首个在手机端运行的27B参数级模型。演示视频显示实时响应且可用。通过量化技术将内存压缩至极致,同时保持模型可用性。该模型表明27B规模的大模型开始走进个人设备。AI模型PrismMLBonsai 27BiPhone 17 Pro1 个信源在谈事件专题推荐理由:27B的模型在手机上跑,内存不到5GB,PrismML的Bonsai做到了。以后手机AI不连网也能用大模型了。原文稍后读已读值得跟进有用关注 PrismML
08:37berryxia@berryxiaPrismML发布Bonsai 27B,这是首个能在手机上本地运行的27B级多模态模型。该模型通过端到端低比特技术,1-bit版本仅3.9GB,可在iPhone 17 Pro上运行;Ternary版本5.9GB,适合笔记本。其智能密度达0.53 per GB,比全精度基线高约10倍,比现有最佳低比特方案高2.7倍。在15个基准测试中,Ternary版平均保留95%性能,1-bit版保留90%,数学、编码和工具调用能力接近原版Qwen3.6 27B。模型已开源(Apache 2.0),支持GGUF格式,提供一键运行Demo和免费开发者预览API。AI模型Bonsai 27BPrismML多模态推荐理由:PrismML搞了个Bonsai 27B,在手机上就能跑27B多模态模型,压缩到3.9GB性能还能保留90%,挺牛的,还开源了,可以试试。原文稍后读已读值得跟进有用关注 Bonsai 27B
08:03berryxia@berryxia73°阿里巴巴开源了Wan-Dancer-14B模型,这是一个14B参数的模型,可以根据音乐生成与节拍同步的舞蹈视频。该模型支持街舞、踢踏、拉丁、K-Pop、中式古典等多种舞蹈风格,并能实现较长时间连贯输出。用户可在本地运行该模型,不再依赖云端服务,大幅降低了音乐驱动舞蹈生成的门槛。此前类似能力多依赖闭源模型或效果不佳,此次开源权重让本地部署成为现实。AI模型Wan-Dancer-14BAlibaba视频生成推荐理由:阿里开源了Wan-Dancer-14B,能根据音乐生成同步舞蹈视频,支持多种风格,本地就能跑,比闭源模型门槛低得多。原文稍后读已读值得跟进有用关注 Wan-Dancer-14B
07:27AK@_akhaliqBonsai 27B 模型现可通过 Hugging Face 的 hf claude 集成在 Claude Code 中直接调用。该模型拥有 270 亿参数,是专为代码和推理任务设计的大型语言模型。用户无需额外配置即可在 Claude Code 环境内无缝使用 Bonsai 27B 进行代码生成、调试与分析。此次整合降低了模型部署门槛,使得开发者能更快在专业代码场景中利用该模型的能力。AI模型Bonsai 27BClaude CodeHugging Face推荐理由:现在你直接在 Claude Code 里就能调用 Bonsai 27B 了,不用自己部署,省事。原文稍后读已读值得跟进有用关注 Bonsai 27B
05:53lmarena.ai@lmarena_aiAgent Arena排行榜基于全球社区提交的百万级真实长周期智能体任务,评估模型在执行复杂工作流时的表现。模型可调用网页搜索、文件系统和终端工具。排行榜采用因果追踪方法,衡量模型相对于平均模型的性能差异。该基准为智能体任务提供了可量化的对比标准。AI模型Agent Arena智能体基准测试推荐理由:想看看哪个模型最擅长完成真实世界的复杂任务?Agent Arena用百万任务和因果追踪方法给出了答案,比普通基准更贴近实际。原文稍后读已读值得跟进有用关注 Agent Arena
05:51lmarena.ai@lmarena_ai精选72°Meta 推出了 Muse Spark 1.1,这是其早期模型 Muse Spark 的升级版。该模型在 Agent Arena 排行榜上位列所有实验室第五、模型排行榜第十七。Meta 同时开放了 Meta Model API 公开预览,开发者可通过该 API 访问 Muse Spark 1.1。模型已在 Meta AI app 及 meta.ai 的 "思考" 模式下可用。AI模型Muse Spark 1.1MetaAgent Arena推荐理由:Meta 终于入局智能体赛场,Muse Spark 1.1 一上榜就拿第五,还开放了 API 和思考模式,想试试新模型可以冲。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
05:49官方账号Meta AI@AIatMeta72°Meta AI 提交其推理与多模态模型参加了亚洲物理奥林匹克(APhO)理论考试。该模型取得满分 30/30 的成绩,与排名前三的学生选手并列。APhO 委员会允许该模型参赛,展示其在复杂物理推理任务上的能力。AI模型Meta AI推理模型多模态推荐理由:Meta 的模型在物理奥赛里拿了满分,和前三名人类选手并列,看看AI的理科能力有多强。原文稍后读已读值得跟进有用关注 Meta AI