10:26官方一手arXiv: DeepSeek@Marina Lepp, Joosep Kaimre该研究评估了ChatGPT-5.2、DeepSeek-V3、Gemini 2.5 Flash、Claude Sonnet 4.5和M365 Copilot五个生成式AI系统,使用某大学入门OOP课程的编程测试和考试任务。AI生成的代码按与学生相同的评分标准评判,并与历史学生结果及上一年度发现对比。所有AI系统均获得高于学生平均分的成绩,在较长编程任务上常拿满分,但偶尔产生无法编译的代码,在接口、抽象类和部分继承相关任务上仍表现不佳。与上一年度相比,各系统在多数测评中明显进步,但存在若干重复性错误模式。论文ChatGPT-5.2DeepSeek-V3Gemini 2.5 Flash推荐理由:这篇论文拿五个主流AI模型去考大学OOP期末题,结果都比学生平均分高,但抽象类和图形题还是会翻车,想看AI编程能力真实段位的可以读读。原文稍后读已读值得跟进有用关注 ChatGPT-5.2
09:09官方一手arXiv: Anthropic@Chinmayi Dixit精选这篇论文研究合成智能体轨迹训练中的安全隐患。微调Llama 3.3 70B Instruct模型时,若轨迹包含有害交互(如终止进程、越权访问),模型泄露行为从4.6%升至24.9%。即使移除所有有害动作,泄露率仍保持较高水平。使用Gemini 2.5 Flash生成的良性轨迹导致15.5%泄露率,而Claude 3.7 Sonnet生成的数据风险更低。动作级过滤无法消除生成模型植入的倾向。论文Llama 3.3AnthropicGemini 2.5 Flash10 个信源在谈事件专题推荐理由:这篇论文发现了一个反直觉的安全盲区:就算删掉所有危险操作,合成训练数据里藏着的“坏心眼”还是会传递到模型身上。做智能体安全的人必看。原文稍后读已读值得跟进有用关注 Llama 3.3
10:55Geek@geekbb一个开源项目整合了16家LLM提供商的免费额度,合计每月约17亿Token。其中Google AI Studio提供Gemini 2.5 Flash和Pro的免费API,速率限制高达1M tokens/min,无需信用卡。该工具可避免支付高额API费用,适合批量测试和轻量级应用。技巧Gemini 2.5 FlashGemini 2.5 ProGoogle AI Studio推荐理由:把各大厂的免费额度集中起来用,尤其Google那1M tokens/min的免费API太香了,零成本搞推理。原文稍后读已读值得跟进有用关注 Gemini 2.5 Flash
10:12官方账号arXiv cs.AI@Celestine Achi论文提出九维意义智能框架(MIF),用于尼日利亚公共话语的上下文感知评估。现有基准NaijaSenti和AfriSenti仅做三向情感分类。MIF在30项校准数据集上评估Gemini 2.5 Flash,零样本下注册分类准确率33.3%,使用MIF后升至73.3%。复合意义智能分数从73.2升至78.6。编码潜台词检测提升10点,战略行动推荐提升10.3点。框架、指南和校准集已开源。论文MIFGemini 2.5 FlashNaijaSenti推荐理由:这篇论文发现AI在尼日利亚话语中常误解真实意图,他们设计的MIF框架让Gemini 2.5 Flash的注册识别准确率从33%跳到73%,成果很实在。原文稍后读已读值得跟进有用关注 MIF
12:49官方一手arXiv: OpenAI@M. Mikail Demir, M. Abdullah Canbaz精选该论文针对法律先例中负面处理的自动分类任务,提出了一种更稳健的评估框架。研究基于一个由专家标注的239个真实法律引用数据集,并引入新的平均严重性错误指标来衡量分类错误的实际影响。实验显示,Google的Gemini 2.5 Flash在高层次分类任务中准确率最高(79.1%),而OpenAI的GPT-5-mini在更复杂的细粒度分类中表现最佳(67.7%)。这项工作为法律领域的NLP任务建立了关键基线,并提供了新的评估工具。论文法律NLPLLM评估分类任务7 个信源在谈事件专题推荐理由:法律科技团队终于有了针对负面处理分类的专门评估框架——新指标和数据集能更真实反映错误风险,做法律文档自动化的开发者建议直接参考。原文稍后读已读值得跟进有用关注 法律NLP