Anthropic 指控 DeepSeek 和 Moonshot 把用户数据偷偷传给 Claude,网信办已经立案,还查到军方数据有没有流向美国,这事挺大的。
#DeepSeek
几条大事打包在一集节目里:OpenAI 和 Anthropic 降价,监管层盯上 DeepSeek 和月之暗面,a16z 还开 AI 学校。
DeepSeek Harness 悄悄上了官方桌面客户端,Win 和 Mac 都有,界面简洁,直接用 DeepSeek Platform 的充值扣费,装一个试试。
DeepSeek 的 Harness GUI 桌面客户端官方下载地址放出来了,Windows 和 Mac 都有,直接去官网下就行,不用再找第三方搬运。
同一套提示词让三个国产模型各做一个 3D Minecraft,谁一次交付就能玩、谁得返工,文章把时间和 token 账都算清楚了。
DeepSeek 发论文讲了训练智能体的沙箱系统 DSec,一天能跑 300 万个沙箱,并发 38 万,做 RL 训练的可以看看。
Ornn 拉了三个月数据:OpenAI 降价 62%,DeepSeek 降 51%,但 B200 租金反涨 50%。想搞清楚钱最后流向谁的,看这篇。
这篇论文造了个诊断集,专门测长上下文模型“找到了但没用上”的问题,DeepSeek 两个模型都被测出检索满分但解读掉分,做长文本评测的可以看看。
Bolt 公了一周真实用量:GLM 5.3 Flash 占 63%,DeepSeek Flash 17%,用户宁可要快的也不挑最大的,这个数据挺说明问题。
Genspark 上线了 GenCode 编程智能体,Claude、GPT、DeepSeek 一个账号随便切,开源模型价格只要十分之一,适合想自己挑模型的开发者。
Cisco Talos 披了个新东西:恶意软件自己调用 Gemini、DeepSeek 等模型投票决定怎么偷你的数据,连人都省了,搞安全的建议看看。
DeepSeek 把训 Agent 最难的环境基建摊开讲了:每秒造 5000 个沙盒怎么做到,容器、虚拟机、镜像加载的全套工程细节都在论文里。
一篇体系结构论文,做了个跨主机的总线互连,64 卡系统上把 RoCE 的延迟砍一半,跑 DeepSeek R1 快 30%-80%,做 AI 集群的你看看。
拿 2267 份真实英国基金申请,让 Gemma 3 27B 和 DeepSeek R1 等六个开源模型打分,跟人类审稿人比相关系数,结论是初筛能用、终审不行。
小米的 MiMo v2.6 Flash 跑分接近 Grok 4.7,成本却只有 1/57,做 agent 的可以看看这份 60 任务实测。
五菱把 DeepSeek 装进了缤果 Pro 的车机,说十种方言都能听懂,还送 3 年无限流量。
OpenAI 用 1 万个代理做了个实验,结果挺有意思的,DeepSeek 也出了个新版本,对长文本处理更便宜了。
智谱AI新出的GLM 5.3 FlashX模型,性能确实有提升,但价格比之前贵不少,而且被DeepSeek的v4.1 Flash模型给超越了。