跳到正文
  1. Hugging Face Blog78

    Nemotron 通过微调在 IOI 2026 与 IMO 2026 达到金牌级成绩

    Nemotron 团队从 Nemotron 3 出发,结合 SFT、RL 和反馈驱动推理,在 IOI 2026 得到 535.4/600,在 IMO 2026 得到 30/42,均达到金牌级门槛。

    推荐理由:文章对比了 Nemotron 在 IOI 与 IMO 中的专门化路径,具体展示微调、反馈推理和验证流程如何协同提升竞赛表现。

  1. GitHub Blog · AI & ML75

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,用于系统评估 AI 代码审查智能体。该基准参考103.9M个GitHub pull requests,包含来自187个公共开源仓库、覆盖19种语言的219个pull requests,并提供多源 golden set、分级分类标注及 grounded 和 augmented 评测指标。

    推荐理由:ReviewBench公开了覆盖219个PR和19种语言的AI代码审查评测框架,并以多源标注、统一评分和96.6%专家一致性支持系统比较。

已经到底了