跳到正文
  1. TechCrunch · AI82

    OpenAI 随 GPT-6 推出 ChatGPT Intelligent UI 界面

    OpenAI 随 GPT-6 推出 ChatGPT 的 Intelligent UI,让对话加入可交互按钮、定制计算器、图表、可编辑图形和示意图。该功能可用于解释飞机机翼原理、展示食谱、规划徒步路线等,并支持用户调低视觉内容的比例。Intelligent UI 面向 Pro、Plus、Business 和 Enterprise 用户全球上线,免费版及低价 Go 用户于周四获得该功能。

    推荐理由:文章具体展示了 Intelligent UI 如何把文本回答扩展为可交互图表、计算器和示意图,并说明了不同 ChatGPT 用户层级的上线安排。

  1. Hugging Face Blog74

    Liquid AI 发布面向端侧的多模态决策模型 d1-3B 与 d1-omni-600M

    Liquid AI 发布两款开放权重决策模型 d1-3B 和实验性的 d1-omni-600M,分别支持文本与图像、文本与图像或文本与音频输入。在七个公开数据集上,d1-3B 的平均分为 82.9,d1-omni-600M 为 78.4;d1-3B 在 Jetson AGX Thor 上单个问题延迟为 16 ms,在 Jetson Orin Nano 上为 50 ms。

    推荐理由:文章将模型结构、公开数据集对比和端侧延迟放在一起,便于判断两款决策模型在质量、模态支持与设备部署之间的取舍。

  1. Google DeepMind77

    Google DeepMind 发布 EmbeddingGemma 2 多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,面向端侧推理。

    推荐理由:EmbeddingGemma 2 将文本、图像、音频和视频统一到共享嵌入空间,并公开端侧内存、上下文和向量压缩数据,便于判断其本地检索适用性。

  1. Mistral AI84

    Mistral Large 4 发布公开预览版,权重将于月底开放

    Mistral AI 发布 Mistral Large 4 公开预览版,这是一个 1 trillion-parameter 原生多模态模型,含 52 billion active parameters。

    推荐理由:原文同时给出模型规模、开放权重计划与多项基准结果,便于比较其在编码、智能体工作流和多模态任务上的定位。

  1. Google DeepMind80

    Google 发布 Gemini 4 Argon,支持 1M tokens 输出并将分阶段开放

    Google 发布新模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全防御等复杂长流程任务,当前先向 Fairwind Program 的可信网络防御者开放。

    推荐理由:原文将 Gemini 4 Argon 的长程推理、企业工作流与网络安全能力放在同一发布框架中,并给出价格、评测成绩和分阶段开放计划。

  1. Microsoft Research60

    Microsoft Research 推出 Quine 生物学 AI 研究系统

    Microsoft Research 推出 Quine,这是一个结合生物学多模态世界模型与交互式研究工具的实验性 AI 研究系统。研究团队在胰腺导管腺癌(PDAC)研究中用它筛选并排序数千种化合物,最高排名化合物在湿实验中产生了最大的预期细胞状态变化,整个流程在一个周末内完成。

    推荐理由:Quine将生物学多模态世界模型与文献、科学工具和湿实验连接起来,并展示了在胰腺癌细胞状态研究中筛选化合物的路径。

  1. Google DeepMind73

    Google DeepMind 在 Gemini Enterprise 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 在 Gemini Enterprise 推出 Gemini 3.8 Live with Live Avatar,为实时对话加入近实时视觉化身。

    推荐理由:原文集中说明了 Live Avatar 如何结合近实时视频、语音和后台工具调用,并交代了 97 种语言、定制化身与 SynthID 水印等落地细节。

  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向规模化语音交互与高复杂度、多步骤推理任务。

    推荐理由:原文同时给出两款模型的定位、语音交互能力、基准成绩与开发者和企业端入口,便于比较其适用场景。

  1. Microsoft Research61

    Microsoft Research 发布 GigaPath-Flash 与 GigaTIME-Flash 高效病理基础模型

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两个开放权重病理基础模型,面向更高效的全切片分析和肿瘤微环境研究。

    推荐理由:文章展示了 GigaPath-Flash 与 GigaTIME-Flash 如何以更低计算成本处理大规模病理数据,并给出模型结构、基准表现与资源估算。

已经到底了