OpenRouter 自曝内部案例:5 个销售加一个 AI 智能体 Rasp,每月省 600 小时,连踩坑经验和模型省钱套路都写清楚了。
#DeepSeek
有人统计了 OpenRouter 的数据,DeepSeek 一家跑的 Token 比 OpenAI、Google、Anthropic、xAI 四家加起来还多,可以看看。
DeepSeek 在 OpenRouter 上的调用量超过了 OpenAI、Google、Anthropic 和 xAI 四家加起来,开源模型的真实使用量值得看看这组数据。
国庆七天AI圈一口气出了 Sonnet 5.5、GPT-6.1 Sol、Gemini 4 Argon,中档模型半价反超旗舰,还有 OpenAI 安全负责人辞职,一篇看完全部大事。
把一份文档直接编译成 LoRA 权重,284B 的 DeepSeek v4 Flash 也能用,top-1 准确率从 63.4% 拉到 84.9%
Bindu Reddy 说中国公司不能套壳 Claude 或 OpenAI,只能硬做模型,所以 DeepSeek、GLM、Kimi 越来越强,观点挺有意思。
博主对比了 Haiku 5.5 和 DeepSeek-V4.1 flash、GLM 5.3 flash 的价格和 Terminal Bench 4.0 分数,顺便吐槽了评论区骂战,看看各方实际差距。
一个人用调 DeepSeek 和 GLM 的开源工具就黑了多家韩国银行,Shinhan Bank 丢了 2.5 万条记录,AI 安全的现实案例。
一个人用 ARTEX 加上 DeepSeek、GLM、Grok 和 Claude Code 就能打穿韩国多家银行,CrowdStrike 的报告把工具链讲得很细。
研究者在 DeepSeek Engram 这类条件记忆架构上做了知识编辑,改一条事实不用重训模型,CoT 推理准确率是基线的近 3 倍,方法细节都在论文里。
有人把 Haiku 5.5 和 DeepSeek、智谱的 flash 模型做了价格和 Terminal Bench 跑分对比,选便宜模型前可以看看这张对比表。
arXiv 上的新论文,教长期智能体把过往推理经验压成一个轻量策略,实验里把 DeepSeek 的推理 F1 从 0.789 拉到 0.868,做智能体记忆的可以看看。
一个专门测地理空间智能体的开源基准,103 个任务打九个模型,Claude Sonnet 4 第一但 DeepSeek V3.2 便宜 11 倍,做 Agent 评测的可以拿来就用。
37FlowAI 拆解了 DeepSeek-V4.1-Flash 在 vLLM 上跑 agent 的优化细节,SWA bounded replay 能明显降低 TTFT,搞部署的可以看看。
DeepSeek 把智能体的 KV 缓存砍到每 token 890 字节,比 V1 小 437 倍,Flash 还在 AA Index 上反超 V4-Pro,价格只要一半不到。
284B 的 DeepSeek V4 Flash 量化到 1.6 bit 只要 60GB,配 128GB 内存的 Surface Laptop Ultra 就能本地跑,视频都放出来了。
LMArena测了Jev Router的实际延迟:中位数6.18秒,比DeepSeek V4.1 Flash的3.64秒慢了一截,P90差距更明显。
Bindu Reddy 直接开炮,说 Haiku 5.5 不如 DeepSeek 和 Luna,Anthropic 该发的其实是 Fable 5.5。
Mistral 晒了新基准成绩:Mistral Large 4 跑 657 个办公自动化任务,赢了 Kimi K3 和 DeepSeek V4 Pro,做 agent 介绍的可以看看。
一篇教代码智能体"怎么从自己的纠错里学到更多"的论文,在 DeepSeek/CodeARC 上把 Pass@1 从 15.0% 拉到 20.4%,做法挺有意思。
一篇降本干货:ECO 在 Qwen、DeepSeek 的分离式部署上实测省 40.5% 能耗,做 GPU 推理优化的可以看看方法细节。
研究者做了个数据集专门判断评审点子是人写的还是 AI 写的,发现 AI 想法大多离不开论文本身,人会带外部知识进来,挺有意思的角度。
Bloomberg 报道 DeepSeek 融资至少 800 亿元,腾讯和 CATL 参与,可能是 IPO 前最后一轮,金额或到 1000 亿。
小团队 Dots.3-preview 居然在性能和成本上都压过 DeepSeek 新模型,作者重点夸了他们的 RL 训练方案,想追国产模型进展的可以看看。