周报|AI Agent 基础设施继续分化,药物发现出现新基准
周报|AI Agent 基础设施继续分化,药物发现出现新基准
本期覆盖时间:2026-04-20 ~ 2026-04-23(含)
本周 AI Agent 领域没有炸裂级新框架,但底层基础设施的分化在继续——有的在解决容灾和成本,有的在优化 token 效率,有的在积累可复用技能。同时,药物发现方向出现了新的评测基准,可能很快会成为 AI 药物公司的标配。
一、AI 与 Agent 工具
1. HAWK:多模态模型的视觉 token 剪枝
CVPR 2026 收录的一篇论文提出了一个叫 HAWK 的方法,解决多模态大模型(MLLM)推理时视觉 token 过多导致的延迟问题。
关键发现:多模态模型里,不同注意力头其实在处理不同的视觉语义——有的看轮廓,有的看纹理,有的看空间关系。但现有方法把所有注意力头当成等价的,一刀切地剪枝,导致重要信息也被删掉。
HAWK 的做法是:先评估每个注意力头对视觉任务的重要程度,然后结合文本引导的注意力权重来判断哪些视觉 token 是冗余的,哪些必须保留。剪枝过程不需要重新训练,可以直接套用到各种多模态模型上。
实验结果:在 Qwen2.5-VL 上,HAWK 删掉 80.2% 的视觉 token 后,精度还能保留 96%;端到端延迟降至原来的 74.4%,显存占用也有明显下降。
为什么值得看:多模态推理是当前 AI 应用的一个瓶颈——视觉 token 多就意味着计算量大、响应慢。HAWK 这种训练-free 的剪枝方法工程落地成本低,效果又足够显著,很可能会成为多模态推理优化的标准手段之一。
Paper: arXiv:2604.07812. Code: https://github.com/peppery77/HAWK
2. UFA:Uber 的容灾降本架构
Uber 本周在 arXiv 上公开了他们内部用了两年多的容灾架构 UFA(Uber Failover Architecture),这是他们从 2 倍容量模型降到 1.3 倍容量的核心工程实践。
问题背景:Uber 全球实时平台之前用 2x 容量模型保证容灾——每个服务都按能处理全球流量来配置,两个区域各备一份,一半的资源平时闲着。利用率只有 20% 左右。
UFA 的思路是把服务分成两类:关键服务保留容灾保障,非关键服务则在稳态下”借”关键服务的备用容量。只有在极端峰值发生真实故障转移时,才触发非关键服务的抢占和快速恢复。系统里有自动化依赖分析保证关键服务在任何情况下都能正常运行。
数字:2x → 1.3x 的稳态配置,利用率从 20% 提升到 30%,可用性维持 99.97%,已消除超过 100 万个 CPU 核心的空闲占用。
为什么值得看:这是少数大厂公开分享的、经过生产验证的基础架构决策。2x → 1.3x 的降本是真实的成本削减,而关键/非关键服务分级容灾的思路在很多有可靠性要求的系统里都有参考价值。
Paper: arXiv:2603.07345
3. Mol-Debate:多 Agent 辩论提升分子设计推理
4 月 22 日 arXiv 新收录的一篇论文,提出了用多 Agent 辩论框架改进 AI 驱动的分子设计。
在文本引导的分子设计中,多 Agent 辩论让不同角色(生成分子的一方、评估分子合理性的一方)的 Agent 互相质疑、逐轮修正,最终提高分子结构的质量和可合成性。
为什么值得看:分子设计是 AI 药物发现的核心环节之一,但现有的 AI 生成方法容易产生”看起来合理但实际上无法合成”的分子。多 Agent 辩论把质疑和修正引入生成流程,这和人类科学家做实验设计时的讨论迭代逻辑有相通之处——可能是 AI 真正深入科学推理的第一步。
Paper: arXiv:2604.12267
二、生物信息学与药物发现
1. PepBenchmark:肽类药物机器学习有了统一基准
4 月 12 日 arXiv 新收录的论文,发布了一套针对肽类药物机器学习的标准化评测基准 PepBenchmark。
肽类药物被认为是”第三类药物”(小分子是第一类,抗体是第二类),但肽类 ML 的发展长期被数据集不统一、评测协议不规范所拖累。PepBenchmark 统一了数据集划分、数据预处理流程和评估协议,让不同模型之间的比较有了统一口径。
为什么值得看:基准的建立往往是一个领域走向成熟的标志。PepBenchmark 把肽类药物 ML 拉到了和蛋白质结构预测类似的规范程度,意味着这个方向接下来会有更快的迭代速度和更可靠的技术比较。
Paper: arXiv:2604.12594
2. 因果推断遇上图神经网络:聚合操作可能破坏因果有效性
4 月 10 日 arXiv 新收录的一篇理论论文,证明了现有图神经网络方法在处理因果推断时存在一个根本性问题:把不同类型的图元素聚合为单一因果变量的操作,可能破坏因果推断的核心假设,导致结论无效。
论文提出了一套基于”最小不可分单元”(smallest indivisible units)的理论模型,可以在图结构数据上保证因果有效性。作者还构建了一套可控的合成数据集来验证理论,并开发了一个可插入现有图学习流程的因果增强模块。
为什么值得看:这不只是一个算法改进,而是一个理论层面的警示——如果聚合操作会破坏因果假设,那么很多基于图学习的因果结论都需要重新审视。在药物靶点发现、基因网络调控分析这些需要因果推断的场景,这个问题的解决与否直接影响结论的可靠性。
Paper: arXiv:2604.08890
三、后续关注
下周值得关注的几个方向:Mol-Debate 的多 Agent 框架是否会在其他科学推理任务中被复现;PepBenchmark 会吸引哪些团队参与评测;以及 UFA 的思路在中小型系统里的降级版实现。