Anthropic 让 950 个 Claude Agent 跑了 21 小时分析噬菌体 DNA,还真找到一个类似 CRISPR 的未知酶系统,科学研究玩法变了。
AI 教育与科研
斯坦福团队做了个 StudentBench,拿 2383 人测 AI 教 GRE,效果跟人类导师打平,价格便宜 918 倍,数学部分回得越快学生学得越好。
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。
Replit 的 CEO 和 a16z 办的新学校聊教育:学编程别报课,挑个自己想做的东西直接上手,AI 时代每人都做得到。
Replit 的 CEO 和 HAA 创始人聊学习:别再上 Python 课,直接用 AI 做个自己想做的东西,比任何教程都管用。
Anthropic 让 Claude 自己读文献、挖基因组数据还提出了验证实验,真发现了一个疑似新基因编辑机制,Dario 亲自发的长文,值得看看 AI 做科研到底走到哪一步了。
AWS 给大学生送了 12 个月的 Skill Builder 高级会员,考证和学习资源都免费用,在读的同学可以去 AWS Builder Center 验证领一下。
量化到 2-bit 后模型做数学题会发疯循环?这篇论文用 on-policy 蒸馏把 MATH-500 保留率从 35% 拉到 70%,做端侧部署的可以看看。
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
sklearn 里的 SMO 算法作者、拿了奥斯卡的 Google 科学家聊 AI 怎么做科学、解决气候问题,访谈内容很扎实。
这篇论文介绍了一种叫 RegKT 的新技术,专门用来提升知识追踪模型的性能,让它在处理教育数据时更稳定,不容易过拟合,同时还能保持模型的可解释性,对做教育应用的开发者可能有帮助。
两位作者教了700+工程师,他们发现多数团队从搭平台、接LLM judge、看分数开始,这是错的,应该先手动读100条真实trace,找到失败模式,评估器才会长出来。
朋友,青海师范大学的藏语智能实验室发布了我国首款藏语多语言全模态 AI 输入法,叫智达 AI 输入法,支持手机、电脑全终端,还能语音输入藏语,挺方便的。