月之暗面的 Kimi K3.1 被开发者从 API 后台挖出来了,100 万上下文加三档推理强度,定价可能和 K3 持平。
全部动态
华为把 openPangu-2.0 从预训练到 RL 的训练代码全开源了,配昇腾 MoE 栈,之前 Pro 505B 和 Flash 92B 权重也能配上完整流程。
StepFun 这个 Step 5 Preview 有 1M 上下文,主打长程智能体任务,权重月底开源,可以等开源后自己跑一跑。
NaiveAI 放出了 MIT 协议的 309B MoE 开源模型,激活参数只有 15.5B,还能吃下 1M 上下文,做长代码分析可以试试自己部署。
美团把 LongCat 升到 2.5 预览版,1M token 上下文加多模态,专门给跑长任务的编程智能体用,不过这次没放跑分数据。
Anthropic 下一款 Sonnet 5.5 被内测网友扒出来了,实测编码干过 GPT-6 Sol,价格只要 $2/百万 token,文章还教你怎么检查自己有没有被灰度到。
一句提示词、100 美元算力,Claude 花几天算出物理学家们卡了两年的九圈振幅,老纪录保持者 Lance Dixon 亲自验算确认没问题,过程细节挺精彩。
有人花 5 欧元租 GPU,让无审查版 Qwen 三十分钟改一个字节就破解了 IDM,这帖子把 AI 逆向能力聊得很具体。
Epoch AI 搞了个新基准,让 AI 看照片对照说明书找宜家家具装错的地方,GPT-6 Astra 拿了 80 分,还顺带测出了各家模型的不同毛病。
一个 FSD 级团队出来做 Physical AI,首版模型 Simate-beta 连同 RoboDojo 一起放出来了,搞具身的可以看看。
OpenAI 的 GPT-6 Astra 看一眼照片就能指出你 IKEA 柜子哪步装错了,准确率 80%,比半年前的 28% 高出不少。
vLLM那帮人创业后干的活:把Kimi K2塞进谷歌TPU,速度比英伟达GPU还快57%,框架还是DeepSeek开源的,搞推理的可以看看细节。
美团放了个 1.6 万亿参数的 MoE 模型,能看图、写代码,还直接兼容 Claude Code,长文档党可以试试。
Google 刚发了两个 TTS 模型,能用 30 秒音频克隆音色、支持 100 多种语言,做游戏配音或有声书可以试试
有人让 Claude Opus 5.5 一条提示词跑 1 小时,写出能跑 34 FPS 的双 5090 路径追踪器,代码全由模型生成。
Google DeepMind 的新掌门亲自确认 Gemini 4 在做 post-training 了,毕竟 3.5 Pro 跳票、对手 Claude 5 和 GPT-6 都已经出街,这篇讲清楚了 Google 下一步怎么追。
OpenAI 要发专攻网络安全的 GPT-6 Cyber 了,今年第四款安全模型,个别客户已经在测,开发者大会还带十几款新品一起亮相。
做 FLUX 的 Black Forest Labs 跑去做机器人了,70 亿参数就在 RoboLab-120 刷了纪录,还开源,搞机器人的可以看看。
同一套提示词让三个国产模型各做一个 3D Minecraft,谁一次交付就能玩、谁得返工,文章把时间和 token 账都算清楚了。
摩尔线程的国产显卡跑通了字节跳动的 Protenix-v2,这模型对标 AlphaFold 3,国内做药物研发的可以关注下算力替代方案。
DeepMind 新掌门首次开口,说 Gemini 4 就在打磨阶段了,之前一直被 OpenAI 压着打的 Google 这次要追分了。
小米把 MiMo-V3 的注意力架构拆开讲了:KV Cache 提前生成、Prefill 少跑一半层数,跑 Agent 时长上下文检索更省更准,细节都在官方这篇说明里。
摩尔线程用 MTT S5000 跑具身 RL,训练曲线和主流 GPU 相关性 0.976,双臂装配成功率 92%,国产卡跑机器人训练又多了个实测数据点。
OpenAI 拿出 1215 段心理对话让各家模型答题,GPT-6 Astra 拿 57.3% 第一,Gemini 2.5 Pro 只有 29.5%,数据集已开放下载。
Gemini 3.5 Pro 跳票后谷歌直接憋了个 Gemini 4,已经进入后训练阶段,年底前就能见到,内部员工还拿它跑编程工具了。
AI 眼镜不用联网也能识图问答了,1-bit 量化让 2B 模型塞进眼镜芯片,速度翻倍、功耗还降,端侧玩法的实用参考。
阿里达摩院的新模型用普通平扫 CT 就能查出早期食管癌,不用插管,敏感性 90%,还发在了《自然·医学》上,做医疗影像的值得看看细节。
月之暗面的 Kimi K3.1 曝光了,会有 Low/High/Max 三档推理和 Swarm 多智能体协作,10 月见分晓。
商汤的 SenseNova U1 Pro 图像模型上线了,走交错式思维链生成,最高能出 8K 分辨率图,Raccoon 应用和 API 都能用。
OpenAI 新出的 GPT-6 Sol 和 Luna 便宜了一半,Sol 跑分还超过了 Claude Opus 5,做大批量任务可以认真看看这个定价。
Anthropic 的 Claude 在自家湿实验室里自己发现了一套类似 Crispr 的酶系统,公司拿它当 AI 做科研的第一个实绩,还赶在上市前公布。
OpenAI 一次出了 GPT-6 Sol 和 Luna 两个模型,价格砍半还带新缓存,跑业务任务比 Claude Opus 5 便宜九成,做 API 应用的可以看看。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…