论文中美对照多源确认03:23Anthropic发布经济影响研究报告Anthropic最新研究,看AI如何改变就业市场,不同职业受影响程度分析#Anthropic#经济影响#就业市场#研究报告6 个信源在谈事件专题The Rundown AI@therundownai7 个信源在谈原文稍后读已读值得跟进有用关注 Anthropic
论文Agent 与开发者02:22GameDevBench基准测试发布CMU博士生发布游戏开发基准,测试AI在1小时内能完成多少人类新手任务#GameDevBench#Arena#游戏开发#基准测试lmarena.ai@lmarena_ai原文稍后读已读值得跟进有用关注 GameDevBench
论文Agent 与开发者精选01:22NeoHorse-1模型实现递归自我改进NeoHorse-1模型实现了AI的递归自我改进,通过代理后训练和路由工具让模型能自主提升能力。#NeoHorse-1#递归自我改进#代理后训练#Hugging FaceAK@_akhaliq原文稍后读已读值得跟进有用关注 NeoHorse-1
论文精选01:21Marigold V2:扩散变换器单目深度估计Marigold V2 发布了,用扩散变换器做单目深度估计,比之前版本更强了。#Marigold#扩散变换器#单目深度估计#深度学习AK@_akhaliq原文稍后读已读值得跟进有用关注 Marigold
论文Agent 与开发者精选00:47Agent优化在于工具边界而非模型本身LangSmith团队发布新论文,教你如何通过工具边界优化提升Agent可靠性,比单纯改提示词更有效。#PRISM#LangSmith#Agent#工具边界Harrison Chase@hwchase17原文稍后读已读值得跟进有用关注 PRISM
论文Agent 与开发者73°23:17微软发布FrogNano小模型编程智能体微软教你用合成任务训练小模型编程智能体,不依赖大模型蒸馏,在普通设备上就能运行。#FrogNano#Microsoft#编程智能体#强化学习elvis@omarsar0原文稍后读已读值得跟进有用关注 FrogNano
论文Agent 与开发者精选73°14:17KVMem提升长上下文推理效率KVMem让Qwen3.6/3.8-27B在笔记本上运行百万tokens上下文,比传统压缩方法效果更好。#KVMem#Qwen3.8-27B#长上下文#推理效率elvis@omarsar0原文稍后读已读值得跟进有用关注 KVMem
论文政策与合规多源确认精选08:28OpenAI与纳维-斯托克斯问题争议Simon Willison解析OpenAI参与千年数学奖争议,揭示"数据使用"定义的模糊地带。#OpenAI#Navier-Stokes#Simon Willison#AI伦理10 个信源在谈事件专题官方账号Simon Willison@simonw11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
论文Agent 与开发者精选08:27DeepMind CaMeL论文防御提示注入DeepMind分享防御提示注入的实用方法,包含模型训练和代码检查多层防护。#DeepMind#CaMeL#提示注入#安全官方账号Simon Willison@simonw原文稍后读已读值得跟进有用关注 DeepMind
论文Agent 与开发者07:12通过离散扩散实现LLM无损加速这篇论文介绍了一种能加速LLM又不损失质量的新方法,速度提升2-3倍,对实际应用很有价值。#离散扩散#LLM#推理加速#开源模型AK@_akhaliq原文稍后读已读值得跟进有用关注 离散扩散
论文Agent 与开发者多源确认78°02:45OpenAI发布Navier-Stokes问题解决方案OpenAI用比GPT-6 Astra更强的模型解决了困扰数学界90年的Navier-Stokes问题#OpenAI#GPT-6 Astra#Navier-Stokes#千禧年难题10 个信源在谈事件专题elvis@omarsar011 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
论文中美对照多源确认93°02:33OpenAI 宣布解决 Navier-Stokes 千禧年难题OpenAI 用上万个 Agent 解决了流体力学千年难题,还和数学家 Buckmaster 有学术争议。#OpenAI#Navier-Stokes#Lean#Agent10 个信源在谈事件专题宝玉@dotey11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
论文Agent 与开发者多源确认78°01:38OpenAI宣布解决纳维-斯托克斯千年难题OpenAI用多智能体解决了存在90年的数学难题,证明AI在基础研究领域的突破。#OpenAI#纳维-斯托克斯#多智能体#数学证明10 个信源在谈事件专题官方账号OpenAI@OpenAI11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
论文Agent 与开发者78°23:50Google DeepMind发布设计文档驱动系统Google DeepMind和MIT团队用设计文档驱动代码生成,性能建模库不再需要修补而是完全重新生成#Google DeepMind#DeepSeek-V3#设计文档#性能建模elvis@omarsar0原文稍后读已读值得跟进有用关注 Google DeepMind
论文多源确认17:16AI扩展与对齐的现状与挑战OpenAI首席科学家Jakub Pachocki分享了他对AI发展的担忧和思考,值得一读。#Jakub Pachocki#OpenAI#AI扩展#AI对齐10 个信源在谈事件专题Thomas Wolf@Thom_Wolf11 个信源在谈原文稍后读已读值得跟进有用关注 Jakub Pachocki
论文Agent 与开发者精选14:51NoRA:LoRA单行改进提升模型训练效果DAIR团队提出NoRA,只需一行代码就能改进LoRA,训练更稳定效果更好,还不增加计算负担。#NoRA#LoRA#模型微调#论文elvis@omarsar0原文稍后读已读值得跟进有用关注 NoRA
论文中美对照多源确认11:50OpenAI首席科学家谈AI现状与挑战OpenAI首席科学家分享对AGI时代的思考,探讨AI发展面临的挑战和选择。#OpenAI#AGI#Jakub Pachocki#AI安全10 个信源在谈事件专题官方账号Greg Brockman@gdb11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
论文Agent 与开发者10:55DeepMind研究主动型智能体DeepMind研究了主动型智能体如何在不打扰用户的情况下提供高级认知支持,对AI助手设计很有启发。#DeepMind#proactive agents#智能体#写作助手elvis@omarsar0原文稍后读已读值得跟进有用关注 DeepMind
论文中美对照07:56ARC 3基准测试不等于AGI证明Chollet解释ARC 3基准测试的真实意义,澄清解决它不等于AGI,避免误解。#ARC#AGI#Chollet#基准测试Gary Marcus@GaryMarcus原文稍后读已读值得跟进有用关注 ARC
论文Agent 与开发者精选73°01:40IBM发布STAIR检索增强生成论文IBM这篇论文用目录结构解决RAG分块问题,在检索准确率和降低幻觉方面都有显著提升。#STAIR#RAG#IBM#检索增强生成elvis@omarsar0原文稍后读已读值得跟进有用关注 STAIR
论文78°07:2221名顶尖学者:LLM是通往AGI的死胡同GaryMarcus分享21名顶尖学者观点,LLM无法实现AGI,真正的智能需要视觉基础。#LLM#AGI#视觉通用智能#GaryMarcusGary Marcus@GaryMarcus原文稍后读已读值得跟进有用关注 LLM
论文73°07:17LLM多智能体系统仅需六种通信拓扑这篇论文提出LLM多智能体系统只需六种通信拓扑,Codebook Agent在性能和效率上都超越现有方案。#Codebook Agent#多智能体系统#通信拓扑#LLMelvis@omarsar0原文稍后读已读值得跟进有用关注 Codebook Agent
论文73°06:42Perplexity分享搜索结果排序技术Perplexity公开了其搜索结果排序技术细节,包括嵌入模型和GPU推理实现。#Perplexity#嵌入模型#排序模型#GPU推理Aravind Srinivas@AravSrinivas原文稍后读已读值得跟进有用关注 Perplexity
论文中美对照06:20Perplexity发布模型服务基础设施研究Perplexity分享了其搜索答案背后的模型服务基础设施研究,展示了如何优化大规模查询处理。#Perplexity#嵌入模型#排序模型#服务基础设施官方账号Perplexity@perplexity_ai原文稍后读已读值得跟进有用关注 Perplexity
论文中美对照精选73°02:17腾讯发布环境进化论文解决智能体训练难题腾讯这篇论文解决了智能体RL的环境供应瓶颈,提出不依赖智能体弱点就能提升环境难度的方法。#Tencent#环境进化#智能体#强化学习elvis@omarsar0原文稍后读已读值得跟进有用关注 Tencent
论文精选73°22:20Google DeepMind研究显示智能体群自发形成作弊与反作弊机制Google DeepMind研究100个智能体如何自发形成作弊与反作弊机制,展示了AI系统中的复杂行为模式。#Google DeepMind#智能体群#数学猜想#知识治理elvis@omarsar0原文稍后读已读值得跟进有用关注 Google DeepMind
论文21:41Apodex发布AI基准测试平台Apodex发布了包含218个测试场景的AI基准平台,首批聚焦生物医学等三大领域,提供真实世界问题评估。#Apodex#AI基准测试#生物医学#临床转化elvis@omarsar0原文稍后读已读值得跟进有用关注 Apodex
论文16:31Ken Thompson编译器安全论文对AI的启示Ken Thompson的编译器安全论文,揭示了AI模型训练中可能存在的类似安全风险。#Reflections on Trusting Trust#编译器安全#AI安全#Ken ThompsonAmjad Masad@amasad原文稍后读已读值得跟进有用关注 Reflections on Trusting Trust
论文14:56情绪是人类智能的核心组成部分Marvin Minsky和OpenAI联合创始人都强调了情绪在决策中的关键作用,这对理解AI局限性很有启发。#Marvin Minsky#The Emotion Machine#OpenAI#情感1 个信源在谈事件专题Amjad Masad@amasad2 个信源在谈原文稍后读已读值得跟进有用关注 Marvin Minsky
论文Agent 与开发者精选73°10:02HarnessDev基准评测LLM创建Agent Harness能力ByteDance团队推出HarnessDev基准,首次评测LLM能否自己创建Agent执行框架,发现模型间harness迁移性极差。#HarnessDev#Agent#LLM#ByteDance1 个信源在谈事件专题shao__meng@shao__meng2 个信源在谈原文稍后读已读值得跟进有用关注 HarnessDev
论文Agent 与开发者精选10:01Repo-To-Skill:将GitHub仓库转化为AI技能GitHub仓库现在能直接变成AI技能,让AI能调用开源代码功能。#Repo-To-Skill#GitHub#AI4AI#开源模型AK@_akhaliq原文稍后读已读值得跟进有用关注 Repo-To-Skill
论文Agent 与开发者10:00HarnessDev:LLM能否创建并演化自己的智能体框架HarnessDev论文探讨LLM能否自主构建智能体系统,值得关注其创新方法。#HarnessDev#LLM#智能体#AgentAK@_akhaliq原文稍后读已读值得跟进有用关注 HarnessDev
论文中美对照78°05:06Google DeepMind发布声明注意力机制论文DeepMind新论文让模型自己决定看哪里,大幅减少长文本处理时的计算量。#Declarative Attention#Gemma-4-31B#Qwen-3-6-27B#长上下文1 个信源在谈事件专题elvis@omarsar02 个信源在谈原文稍后读已读值得跟进有用关注 Declarative Attention
论文精选73°20:21AI Agent 自我进化失效研究ByteDance Seed 和 TokenWave 的研究揭示了AI Agent自我进化的难点,值得关注。#Self-Developing Agents#AI Agent#自我进化#研究1 个信源在谈事件专题shao__meng@shao__meng2 个信源在谈原文稍后读已读值得跟进有用关注 Self-Developing Agents
论文精选08:47持久化智能体架构研究论文发布这篇论文提出了一种让智能体跨平台迁移的架构,解决了智能体长期运行时的身份连续性问题。#智能体#持久化架构#arXiv:2609.00546#迁移机制elvis@omarsar0原文稍后读已读值得跟进有用关注 智能体
论文06:47FrontierSWE v2 发布超长编码基准测试ProximalHQ 推出了超长编码基准 v2,Claude Fable 5.1 在测试中大幅领先其他模型。#FrontierSWE#Fable 5.1#Claude#ProximalHQelvis@omarsar0原文稍后读已读值得跟进有用关注 FrontierSWE
论文73°00:23ExtractBench基准测试在Kaggle上线LlamaIndex在Kaggle上线了ExtractBench基准,测试370份企业文档的提取能力,看看各工具表现如何。#ExtractBench#Kaggle#LlamaParse#Claude Code1 个信源在谈事件专题LlamaIndex@llama_index2 个信源在谈原文稍后读已读值得跟进有用关注 ExtractBench
论文Agent 与开发者78°23:48字节跳动发布HarnessDev自进化智能体框架字节跳动新出的HarnessDev框架,让AI从完成任务进化到构建智能体,在写作和ML实验上已能匹敌人工工程。#HarnessDev#ByteDance#智能体#自进化1 个信源在谈事件专题elvis@omarsar02 个信源在谈原文稍后读已读值得跟进有用关注 HarnessDev
论文精选73°10:33图记忆与平面检索在长期智能体中的性能对比研究这篇论文实测了图记忆vs平面检索在长期智能体中的真实表现,数据详实,结论明确。#LongMemEval#图记忆#平面检索#长期智能体1 个信源在谈事件专题elvis@omarsar02 个信源在谈原文稍后读已读值得跟进有用关注 LongMemEval
论文中美对照73°06:33Meta发布AI研究偏好模型Meta新模型帮AI研究代理智能选择实验,比传统方法快30%,省1/3算力#Meta#AI Research Preference Models#研究代理#AIRS-Benchelvis@omarsar0原文稍后读已读值得跟进有用关注 Meta