全部 AI 动态 · AI 热点

6月19日

09:35

09:35

arXiv: DeepSeek@Shi Chen, Rongcun Wang, Yuan Tian, Xiaoyuan Xie, Wei Song, Rubing Huang

该论文提出了SolidityBench，包含5,470个存储库级Solidity智能合约及其自然语言描述。同时提出SolidityScore，一种关注安全性修饰符、合约声明等域关键结构的语义度量。研究评估了Qwen2.5-Coder、DeepSeek-Coder和CodeLlama等模型在零样本、思维链、上下文学习、检索增强生成和监督微调五种方法上的表现。结果显示，通用模型在存储库级Solidity生成中存在结构性缺陷；在非参数方法中，检索增强生成效果最佳，而上下文学习在超过两个示例后因上下文饱和而性能下降；监督微调通过将Solidity特定约束内化到模型参数中实现了最大改进。

论文 Solidity SolidityBench SolidityScore Qwen2.5-Coder DeepSeek-Coder CodeLlama 智能合约代码生成

推荐理由：这篇论文为Solidity智能合约代码生成建了个新基准（5470个合约）和专用评分指标，测试了多个主流代码模型的各种方法，结论明确：靠谱的领域数据+微调最管用。

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

6月5日

02:05

02:05

rohanpaul_ai@rohanpaul_ai

Google DeepMind 发表论文，提出一个智能委派框架，将 AI 任务分配视为一系列动态选择，而非简单指令。框架引入智能合约、可验证数字证书和形式化信任模型，避免过度委派或委派不足。它支持 AI 代理间相互委派，并确保责任可追溯。该框架通过自适应机制处理任务失败，并设置验证规则确保输出可靠。这为企业安全使用 AI 提供了结构化方法。

论文委派框架智能合约信任模型 AI 代理 DeepMind

推荐理由：做 AI 工作流设计或企业级 AI 部署的团队，这篇论文给出了从委派决策到结果验证的完整框架，值得研究参考。

5月12日

19:11

19:11

arXiv: OpenAI@Gabriela Dobrita, Simona-Vasilica Oprea, Adela Bara

CHAINTRIX提出了一种端到端的智能合约审计框架，核心设计是确保每个LLM生成的声明都能通过确定性结构合约表示进行验证。该框架引入跨合约交互模型（CCIM），将Solidity代码解析为函数级操作的结构化映射，支持12个确定性信号引擎和并行LLM审计管道。此外，通过引入结构判决引擎（SVE）执行确定性结构检查，并结合符号执行和模糊测试来过滤低置信度发现。在EVMbench基准测试中，CHAINTRIX达到了71.7%的高危漏洞召回率，超越最强前沿模型26个百分点，部分审计实现100%召回，显著提升了审计的准确性和可靠性。

论文智能合约 LLM/增强安全审计确定性分析审计框架

推荐理由：该工作为智能合约安全审计提供了一种结合LLM与确定性分析的有效方案，解决了LLM幻觉和传统静态误报问题，对DeFi安全领域具有实际参考价值。