想看国内哪款AI应用用户最多?QuestMobile数据告诉你豆包月活3.8亿断层领先,千问增速近58倍,值得关注。
#DeepSeek
想研究LLM在社交推理中的真实信念?MafiaScope用探针实验和反事实回放,让你看到智能体表面的伪装。DeepSeek案例数据很硬核。
这篇论文用实验数据告诉你,大模型评政策时会看谁站台——同一政策挂美国旗得分高,挂中国旗得分低。GPT-5、Claude Sonnet、Gemini、DeepSeek表现各异,值得关注。
分析师 Ara Kharazian 用 Ramp AI Index 数据告诉你:Anthropic 企业份额达 42%,DeepSeek 只有 0.3%,别高估开源模型的威胁。
各家疯狂出新模型,OpenAI今天正式发GPT-5.6,谷歌的Gemini 3.5 Pro快了,中国也有新动作,竞争太激烈了。
想了解OpenAI、Anthropic、xAI和国产模型的最新动静?这篇爆料把GPT-6的加速发布、Mythos引发的连锁反应都串起来了,还提到DeepSeek V4和GLM-5.2的竞争,信息量很大。
DeepSeek比Claude便宜九成,性能差距不到十个月,美国企业批量迁移,OpenRouter数据硬核实锤,省钱看这篇。
这篇论文教你怎么用 ASV 框架来拆解 AI agent 每一步的决策价值,在开放问答任务上实测发现短 rationale 反而有害,做 agent 评估的必看。
DeepSeek 在搞自己的 AI 推理芯片,想少用英伟达和华为的货。项目才起步,但已有分析师不看好海外市场。看国产大模型如何突围硬件依赖。
想低成本跑DeepSeek?有第三方用SGLang和AMD MI300把API成本压到官方的五分之一,技术方案公开,值得参考。
Marc Andreessen 直接评价说 DeepSeek 的 Fable 可能已经接近 AGI 的门槛,这个判断来自顶级投资人,值得关注。
OpenRouter 数据显示 DeepSeek 的 token 份额半年翻倍,智能体场景是推手,值得开发者关注。
网信办这次动真格了,清理了 600 万条违规信息,下架 1.4 万款产品,连带华为、阿里都加强了审核。想了解 AI 监管风向的可以看。
DeepSeek 出了个叫 Deep Code 的开源编程助手,专门搭配 V4 模型用,能记对话续任务,改代码跑命令一气呵成。
用贝叶斯方法修LLM当裁判时的废话偏好和位置偏差,实测召回从0.5拉到接近1,比直接投票靠谱多了。
DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。
这篇论文搞了个标准协议EPC,专门用来测LLM代理系统里评估器偏好怎么耦合的,还附带了GPT-4o、Qwen、DeepSeek等8个评估器的大规模实测数据,方便你复现和对比。
DeepSeek破天荒大规模招人了,所有部门翻倍,33个岗位全收实习,连Agent Harness团队都缺人。想去搞AGI的赶紧看看!
Cline出了月付9.9美元的token计划,能用DeepSeek、Kimi、GLM5.2等模型,现在还有1.99美元试用价,挺划算的。