DeepSeek 175B在消费级笔记本上完成20万蛋白质配体虚拟筛选
研究人员成功将1750亿参数的DeepSeek 175B模型部署在单台RTX 4060笔记本电脑上,该设备配备32GB系统内存和8GB显存。该框架完成了针对20种不同蛋白质靶点的20万规模蛋白质配体虚拟筛选工作流。在相同任务配置下,该实现比8卡A100集群基线快100倍,平均结合亲和力预测误差为0.88 kcal/mol,满足临床前药物发现的1.0 kcal/mol化学精度要求。
研究人员成功将1750亿参数的DeepSeek 175B模型部署在单台RTX 4060笔记本电脑上,该设备配备32GB系统内存和8GB显存。该框架完成了针对20种不同蛋白质靶点的20万规模蛋白质配体虚拟筛选工作流。在相同任务配置下,该实现比8卡A100集群基线快100倍,平均结合亲和力预测误差为0.88 kcal/mol,满足临床前药物发现的1.0 kcal/mol化学精度要求。
AQuA是由普林斯顿、蚂蚁集团和斯坦福研究人员开发的双部分智能体框架。该框架专注于量化金融中的自主因子发现和模型开发。研究解决了量化研究代理在实验中可能污染证据的问题。AQuA通过分离作者和审查者角色来避免共享盲点。
Anthropic发布了Claude Fable 5.1和Claude Mythos 5.1两个版本模型。Fable 5.1在Terminal-Bench-Science 0.1基准测试中得分为52.6%,较Fable 5的24.7%有显著提升。新模型支持1M token上下文窗口,缓存读取成本降低75%至每百万token 0.25美元。Fable 5.1已开放API访问,而Mythos 5.1仍限制在Glasswing项目内的经过审核的组织使用。
Anthropic今天发布Claude Fable 5.1和Mythos 5.1,两个模型性能显著提升。Fable 5.1在Terminal-Bench-Science 0.1测试中得分52.6%,较Fable 5的24.7%翻倍。缓存读取价格降低75%,企业客户数据留存争议得到解决。Mythos 5.1在蛋白质设计上结合亲和力比行业最佳提交高10倍。
OpenAI推出Astra模型,成为首个满足Preparedness Framework框架下关键网络安全能力阈值的模型。该模型具备更强的发布安全防护措施。Astra代表了OpenAI在AI安全领域的重要进展。
t54在Amazon Bedrock AgentCore上构建了x402-secure信任层,该系统会在自主代理付款前对每个端点进行评分。该系统通过会话预算、凭证隔离和确定性信任门控,已管理超过2000万次代理发起的交易,无需人工干预。
OpenAI宣布ChatGPT现在可连接医疗记录和行业数据。该功能帮助临床医生安全访问患者上下文信息。医疗组织可将电子健康记录与额外行业数据连接至ChatGPT。系统支持访问医学研究资料。
Boomi Scribe是AWS上的AI智能体,可自动生成企业集成工作流文档。该系统使用Amazon Bedrock、Amazon SageMaker AI、Amazon S3、Amazon DynamoDB和AWS Lambda技术。Boomi Scribe能够解析集成DAG图,生成详细文档,并大规模比较组件版本。
ZS构建了安全加固的Amazon SageMaker平台,平衡了开发者敏捷性与医疗级治理。该平台每天服务1,000多名活跃用户,跨越200多个SageMaker领域。平台专为医疗行业设计,确保数据安全与合规性。
Google发布Gemini新功能,支持智能体视频理解。该功能能分析视频内容并回答相关问题。Gemini在视频理解基准测试中表现优异。此功能已向部分用户开放使用。
Jamf使用IAM客户托管策略、Amazon Athena成本视图和无服务器AWS Lambda循环,为Amazon Bedrock构建了实时、按用户的支出执行系统。该系统在接近实时的情况下应用分层模型限制,不会中断活动会话。随着生成式AI采用规模的扩大,成本治理已成为主要挑战。Jamf的解决方案通过分层模型限制实现近实时支出控制。
Basis、Clay和Exa Labs三家公司使用AI智能体优化客户入职流程、账户管理和开发者集成。这些AI原生企业展示了如何将AI技术融入日常运营。企业领导者可以借鉴这些实践案例。
多伦多大学数学家Daniel Litt指出,AI模型无法生成复杂长证明,因为缺乏正确性验证能力。他提到有800页AI生成的数学证明,但模型无法验证其正确性。Litt认为OpenAI和Anthropic可能已解决更多问题,但不确定结果是否正确。AI擅长计算和整合技术,但无法构建理论或保持精确哲学思考。
NVIDIA与CrowdStrike合作测试SafeMind智能体系统。该系统通过AI模拟攻击,将遥测数据转化为检测规则,并测试新攻击路径。测试结果显示系统能够防御未见过的攻击类型。CrowdStrike的SafeMind系统在网络安全领域展现了创新应用。
Linear产品负责人Nan Yu宣布加入OpenAI,将负责Codex和ChatGPT产品开发。他在Linear工作了4年,期间参与了多个重要项目。Nan Yu将把在Linear积累的软件产品经验带到OpenAI。
研究人员开发了ECGQuest,一个包含10,904个唯一真/假问题的数据集,源自23篇心电图参考文献和2003-2025年Computing in Cardiology会议。该基准测试了3个商业和20个开源语言模型,零样本准确率在49.5%至74.4%之间,GPT-5表现最佳。微调使5个开源模型(7-14B参数)的准确率提升6.5-14.1%,其中DeepSeek-R1-Distill-Qwen-14B达到76.3%。
研究人员提出Soft Latent Thinking方法,在推理过程中用轻量投影器替代大词汇量头。在DeepSeek-Qwen-1.5B和LLaMA-3.2-3B模型上测试,该方法在所有k值下均提升pass@k指标,同时减少思维链每步计算量。该方法在所有软思维方法中达到最高pass@32,证明连续空间可有效进行推理。
该研究探讨了大型推理模型(LRM)如何随着人类监督逐渐退出学习循环而持续改进。论文提出了从L0到L4的五级阶梯,追踪学习过程中哪些部分仍受人类控制。研究分析了奖励机制从单个人类判断发展到可重用验证器的过程,以及学习从人工策划任务向自主生成课程和环境演进的路径。
研究显示,LLM评估在检测AI临床笔记中的遗漏信息时表现不佳,准确率仅为0.50-0.63。研究人员构建了包含500个单错误笔记对的基准测试,其中298个包含确定缺失的事实。通过重构任务,将检测流程改为先列出转录文本中建立的事实,再检查笔记是否包含每项事实,检测效果显著提升。
TSPFN是专为生理时间序列分类设计的基础模型,重构了TabPFN架构以捕捉时间依赖性。该模型在140,000个多医学领域的生理时间序列上预训练,在多个生理学基准测试中表现优于标准表格基线和TabPFN。相比专业深度时间序列模型,TSPFN展现出更好的跨领域泛化能力。
Atos通过AI League活动在三天内培训了400名工程师。工程师们在AWS平台上构建了多智能体系统。这种实践学习方式弥补了理论学习的不足。活动展示了企业如何实施AI技能提升计划。
Amazon Quick概念验证项目常因安全团队审查生产计划而停滞。本文介绍如何设计仪表盘、Spaces、知识库、代理和Flows,并包含可扩展的安全控制措施。具体包括数据集塑造、代理隔离、文档分类和审批门等安全控制。
本文介绍了一套AI原生思维训练方法,包含找需求、判边界、最小验证到重设计与落地验收五个步骤。该方法将产品、Agent与个人成长纳入反馈循环,形成持续改进机制。作者提出这套方法适用于各类AI项目开发和个人能力提升。
Deep Research Agent是一个基于LangChain Deep Agents构建的研究智能体,采用搜索优先架构。该智能体实时规划研究,将工作分解为小步骤,搜索网络资源,检索结果来自Liner平台。每个最终答案中的声明都有检索结果来源支持,完整报告可保存为Markdown文件。
Vercel发布了一篇关于如何使用design.md文件让各种编码代理生成符合品牌设计页面的文章。他们通过公开的design.md和CSS文件,将header、表格、数据条、图表等设计元素定义为有限的class/token。代理只需在HTML中使用这些预定义名称,无需自行设计字号、间距和布局。文章还提供了Build your own教程,指导读者从头开始构建类似系统。