8月26日
00:31
8月24日
20:28
8月14日
03:34
8月13日
17:49
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
精选
研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。
推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。
7月14日
21:06
21:06IT之家博客/媒体
IBM 预计第二季度营收 172 亿美元,低于市场预期的 178.6 亿美元。调整后每股收益 2.93 美元,低于预期的 3.02 美元,股价盘前暴跌约 20%。客户将资本支出转向服务器、存储等基础设施,挤压软件预算。微软、ServiceNow、Salesforce 等软件股随之下跌 3% 至 5%。

推荐理由:IBM 说客户把钱都拿去买服务器搞 AI 基建了,软件预算被挤掉,自己股价暴跌 20%,连微软都跟着跌。看看这波冲击有多大。
6月1日
22:33
22:33官方一手Hugging Face: Blog博客/媒体
精选
IBM研究指出,当前企业AI采用率低的关键原因在于过度关注大型语言模型(LLM)本身,而忽视了智能体逻辑(Agent Logic)的重要性。智能体逻辑包括任务分解、工具调用、状态管理和错误处理等结构化流程,这些才是实现可靠、可扩展企业AI应用的核心。文章提出,企业应构建基于智能体逻辑的架构,而非单纯追求更强大的LLM,以实现AI的规模化落地。
推荐理由:企业AI团队常陷入“换更大模型”的误区,IBM这篇分析点出了真正瓶颈——智能体逻辑。做企业AI落地的架构师和决策者值得一读,能帮你重新思考技术选型方向。
5月28日
10:36
10:36@hebbia@hebbia
联邦资金正在放大现有的量子计算建设,IBM持续的研发投入现在得到了华盛顿的支持。这一举措将加速量子计算技术的商业化进程,IBM作为行业领导者将受益于政策与资金的双重推动。量子计算在药物研发、材料科学等领域的应用前景更加明朗。

推荐理由:量子计算赛道迎来政策与资金双重利好,IBM的研发投入获得联邦背书,关注量子计算进展的投资者和科技从业者值得一看。
02:42
02:42官方一手Hugging Face: Blog博客/媒体
IBM与Artificial Analysis联合推出ITBench-AA,这是首个针对企业IT运维场景的智能体基准测试。测试涵盖事件响应、故障排查等真实任务,结果显示包括GPT-4、Claude在内的前沿模型平均得分低于50%。该基准揭示了当前AI智能体在处理复杂企业IT流程时的能力短板,为行业提供了可量化的评估标准。
推荐理由:企业IT团队终于有了衡量AI智能体真实能力的标尺——前沿模型都不到50分,说明自动化运维还有很大提升空间,做IT运维或AI落地的建议点开看看差距在哪。
5月13日
19:12
19:12官方账号arXiv cs.LG@Ariel Gera, Shir Ashury-Tahan, Gal Bloch, Ohad Eytan, Assaf Toledo
精选
IBM研究团队提出一种LLM引导的查询精调范式,通过生成式LLM对少量文档的反馈,实时优化用户查询的嵌入表示,从而扩展嵌入模型在零样本搜索和分类任务中的适用性。实验表明,该方法在文献搜索、意图检测、关键点匹配等任务上带来最高25%的相对提升,且能改善排序质量和类别分离度。该方案让嵌入模型在无法大规模使用LLM的场景下成为有竞争力的替代方案,代码已开源。
推荐理由:零样本搜索和分类是信息检索的硬骨头,IBM用LLM引导查询精调把嵌入模型性能拉高25%,做搜索/分类的团队可以直接拿开源代码试试,成本比全量LLM推理低得多。