陈孝良的个人专栏分享 http://blog.sciencenet.cn/u/brygid 谈谈声学,聊聊智能

博文

从WAICA 57篇论文观察物理AI与青年学生的研究方向 精选

已有 11190 次阅读 2026-7-20 21:06 |系统分类:教学心得

57篇论文当然不足以代表整个AI领域,论文题目也不能替代对全文的细读。不过,WAICA 2026公开的主会录用名单作为一个相对集中的样本,仍为我们提供了一个观察近期AI研究的窗口:一些研究不再满足于生成答案和展示能力,而是进一步追问证据如何验证、行动如何反馈,以及模型如何接受物理规律、科学机制和真实条件的约束。相比简单追随下一个热点,青年学生或许更需要长期积累三种能力:提出具体问题,识别关键失败,并组织足以经受真实任务检验的证据。

一、模型越来越强,学生为什么反而更难选方向?

前不久,一位年轻学生问我:“大模型、智能体、世界模型、具身智能都很热,我到底应该选哪个方向,才有可能做出真正有价值、也能够发表的工作?”

这个问题很诚实。过去,学生担心自己不会写代码、没有算力、缺少数据;现在,AI可以辅助检索、编程、绘图和写作,执行门槛似乎降低了,方向焦虑却更严重了。因为当所有人都能快速调用相似的模型,越来越稀缺的,也许不是“把模型跑起来”,而是判断什么问题值得跑、什么证据足以支持结论,以及模型何时不应该被相信。

7月18日至20日,世界人工智能大会·学术(WAICA 2026)在上海举行,官网公布了57篇主会录用论文。我有幸参与本届大会的程序委员会工作,不过本文所依据的仅是所有读者都可以查阅的论文题目与公开议程。整理这些公开材料时,我想到的并不是今年又出现了多少新模型和新概念,而是想借这个样本,与青年学生一起讨论一个更具体的问题:当AI逐渐走出屏幕,青年学生可以从哪些真实问题中找到自己的研究入口?

以下分析仅基于公开信息,不涉及未公开稿件、评审意见或程序委员会内部讨论;文中的分类和判断也只代表个人观察。

二、以57篇公开论文为窗口:AI是否正在换一张试卷?

如果只根据论文题目,这57篇论文覆盖大模型、智能体、多模态、医学、分子、偏微分方程、机器人和计算系统,似乎非常分散。为便于观察,我依据公开题目所体现的主要研究问题,对每篇论文进行一次探索性的单标签归类。对于同时涉及多个方向的论文,只保留题目中最核心的问题,因此这一分类具有一定主观性,不应被视为大会官方分类。按照这一口径,可以看到三个规模相近的主题群:智能体、推理与评测14篇,多模态感知与生成14篇,AI for Science与健康13篇;系统效率8篇,可信AI与治理5篇,组织、工业与机器人应用3篇。

标题: WAICA 2026主会57篇录用论文的六类主题分布横向条形图 - 说明 WAICA 2026主会57篇录用论文的六类主题分布横向条形图

图1|基于公开题目的探索性主题归类(非大会官方分类)

在这一探索性分类中,比“大模型仍然热门”更令我关注的是,评测、验证、失效诊断、物理反馈、长期推演、工具使用和系统恢复等问题反复出现。至少从这些公开题目看,一部分研究正在把问题从“模型会不会”推进到“结论依据是什么、模型在哪里会错,以及行动之后如何反馈与恢复”。

三、从答对到负责:尝试把近年一些变化概括为四种倾向

标题: AI研究从表示生成走向推理验证、物理落地与系统行动的四级迁移图 - 说明 AI研究从表示生成走向推理验证、物理落地与系统行动的四级迁移图

图2|从答案生成到系统责任的四级研究迁移

1. 从“答案”转向“证据”

公开论文中,有论文追问大模型在组学任务中能否给出生物学依据,有研究为研究级数学推理建立可更新的失效诊断基准,也有工作用共识评分规则评价深度研究报告。它们共同提醒我们:在涉及科学推理和真实决策的任务中,准确率往往只是起点;结论能否被检验、追溯和复现,决定了模型输出能否进一步成为可信证据。

对学生来说,这意味着“做一个新模型”不再是唯一入口。一个能够发现现有模型在哪些边界条件下失效、为什么失效、怎样可靠评测的工作,同样可能构成高质量论文,在某些情况下,这类工作可能比缺乏机制解释的微小平均性能提升更具长期价值。

2. 从“聊天”转向“行动”

MCPVerse、分支策略优化、主动感知、机器人失效分析等公开题目表明,智能体研究正在进入真实工具和反馈闭环。当智能体从对话走向真实任务时,仅仅让模型调用若干接口已经不够。当系统开始对外部环境采取行动时,不完全观测、反馈延迟、工具失败以及部分不可逆后果,就会成为无法回避的研究问题。

因此,一个更完整的智能体研究不宜只比较“任务完成率”,还应研究失败分类、恢复策略、成本、时延、安全边界和可审计轨迹。科研价值常常藏在成功演示之后那些不好看的失败里

3. 从“相关性”转向“物理与机制”

物理信息合成数据、物理反馈分子生成、PDE长期推演、细胞世界模型和湍流生成等工作,让“物理AI”相关研究开始更加丰富。世界模型的价值,也不是生成一段看起来像现实的视频,而是在给定状态、边界和行动之后,对世界如何变化作出可检验预测。

这里借用一个我相对熟悉的海洋声学例子,并不是因为它比其他科学问题更重要。如果模型在给定声速剖面和边界条件下预测出违反传播规律的声场结构,或者在长距离外推中产生非物理能量增长,它的图像或许漂亮,却可能让水下装备作出错误决策。因此,物理约束不应只表现为损失函数中的一个附加项,还需要通过边界条件、守恒关系、求解器残差或长期稳定性等指标接受独立检验。对于可能影响真实装备决策的模型,这种检验尤其重要。

4. 从“演示”转向“系统”

边缘推理、训练故障恢复、GPU集群调度、量化脆弱性和通信吞吐等研究看起来没有“像人一样思考”那么吸引眼球,却决定了AI能否真正离开实验室。现实世界不会无限供应显存、带宽、电力和时间。一个只在理想服务器、干净数据和单次实验中成功的模型,还不能成为可靠基础设施,对于产业部署而言尤其如此。

四、青年学生怎样选择方向?不妨先看自己的“证据条件”

研究方向选择当然需要关注领域发展,但或许更重要的是判断:自己能够获得什么数据、理解什么机制,并能够持续获得和验证哪一类证据。下面这张图把研究环境和研究贡献放在两个轴上:横轴从数字空间走向物理世界,纵轴从性能提升走向机制与可靠性。四个象限都有机会产生高质量工作,但需要的资源完全不同。

标题: 按数字到物理、性能到机制两个维度划分的青年学生AI选题地图 - 说明 按数字到物理、性能到机制两个维度划分的青年学生AI选题地图

图3|面向青年学生的AI选题地图

方向A:验证与失效科学——发现平均指标掩盖的问题

验证与失效研究未必依赖最大规模的训练资源,却高度依赖严谨的实验设计。可以研究数据泄漏、分布外失效、校准、幻觉、鲁棒性和基准污染。关键不是再做一个“大而全”的榜单,而是定义一种过去被平均指标掩盖、又真正影响应用的失败。

方向B:物理AI与AI for Science——让领域知识进入模型与评价

数学、物理、声学、海洋、材料、生物和医学背景,不是转向AI时需要抛弃的旧知识,反而可能帮助研究者提出更具体、也更难由通用模型直接替代的问题。较有说服力的贡献往往不只是“用Transformer解决某领域问题”,而是把守恒律、边界条件、机制假设或实验反馈变成可检验的模型结构和评价指标。

方向C:智能体与真实系统——研究失败恢复,而不只是成功演示

系统、机器人或产业场景资源较强的学生,可以研究工具使用、长期任务、记忆、权限、恢复和人机协作。尤其值得关注的是:智能体在什么情况下知道自己不确定,何时应该请求人类介入,怎样留下可审计的决策轨迹。

方向D:模型与系统效率——让效率收益可测量、可复现

算法和工程能力较强、有稳定算力的团队,可以继续做表示学习、推理加速、量化、调度和适配。这类论文尤其需要回答:收益来自哪里,在哪些负载下成立,是否以精度、能耗或稳定性为代价,能否被独立复现。

五、怎样把一个方向变成可检验的研究问题?

热点只能提供研究语境,论文仍需要形成一条清晰、可检验并允许被反驳的论证链。对多数学生而言,与其先选择一个最新模型,不如先检查自己的研究是否回答了下面五个问题。

表1|从研究方向到研究问题的五项证据检查

步骤

论文要回答的问题

常见反例

定义真实失败

从模型在现实任务中的具体失效出发,而不是从一个新热词出发。

“首次将某模型用于某数据集”

提出可证伪主张

把“更好”改写成带条件的判断:在何种分布、边界或资源限制下,为什么更可靠。

“整体性能优于基线”

建立充分而公平的基线

比较对象应尽可能包括合理的简单方法、相关主流方法和关键消融,并说明基线选择依据。

只比较弱基线

设计机制证据

除平均准确率外,加入残差、校准、失败类型、长时推演、成本或因果干预。

只有平均分和显著性

明确适用边界

报告什么时候无效、需要哪些数据和算力,以及部署中可能出现的风险。

结论外推到所有场景

下面仍以我较熟悉的海洋声传播为例,目的只是展示如何把一个宽泛方向转化为可检验问题,而非主张所有学生都应选择这一领域。

假设学生研究海洋声传播神经算子。一个相对直接的选题是:“把最新网络用于声场预测,平均误差降低了。”一个更强调机制与边界的提问方式则是:“现有神经算子在训练分布内误差很小,但在新声速剖面和长距离推演中违反离散求解器残差并发生不稳定;引入求解器一致约束后,能否在分布外环境中降低物理失效?”

后者自然导出更完整的证据:预测误差、离散残差、长时稳定性、分布外泛化、不确定性校准、计算成本和关键消融。此时,贡献重点便不只是替换网络结构,而是识别一种可能被平均指标掩盖的失效,并提出可通过实验检验的机制解释。

六、青年研究者可以经常自查的五个问题

1.    是否存在热点拼接:标题包含多个热门概念,但核心科学问题仍不够清楚?

2.   是否过度依赖平均指标:除了总体性能,是否分析了错误类型、分布变化和实际代价?

3.    物理约束是否停留在形式上:加入PDE相关损失后,是否进一步检验了守恒关系、边界条件和长期稳定性?

4.    研究路线是否与资源匹配:有限资源能否被用于更精确的问题设计,而不是简单复刻规模路线?

5.    结论是否超出证据边界:来自单个数据集或模拟器的结果,能够支持多大范围的外推?

结语:AI降低了执行门槛,也抬高了问题门槛

在AI工具迅速普及的时代,年轻人当然需要学会使用大模型。但仅仅比别人更熟练地写提示词、调用接口、生成代码,很快就会从优势变成基本技能。更值得长期培养的科研能力,是进入真实问题,定义模型失败,设计足以区分不同解释的证据,并诚实说明系统的边界。AI降低了执行的门槛,却抬高了提出真问题的门槛。

今年5月,我曾把海洋称为AI最艰难的物理课堂。现在,我更愿意补上一句:科学也许是AI最严格的考官之一。青年研究者不仅可以帮助模型提高答题能力,也可以提出更好的问题,并设计能够检验证据、物理一致性与系统责任的新方法。当AI逐渐走出屏幕,关于证据、机制和责任的探索,或许才刚刚展开。

附录:引用资料与延伸阅读

[1] WAICA 2026程序委员会:https://waica2026.worldaic.com.cn/committees/

[2] WAICA 2026主会录用论文:https://waica2026.worldaic.com.cn/program/accepted-paper-list-main-conference/

[3] WAICA 2026议程概览:https://waica2026.worldaic.com.cn/program/program-glance/

[4] Raissi, Perdikaris & Karniadakis (2019), Physics-informed neural networks:https://www.sciencedirect.com/science/article/pii/S0021999118307125

[5] Li et al. (2021), Fourier Neural Operator for Parametric Partial Differential Equations:https://openreview.net/forum?id=c8P9NQVtmnO



https://blog.sciencenet.cn/blog-1375795-1544453.html

上一篇:海洋稀土之争:日美探索研究的路径、产业验证与治理跟踪
下一篇:从反潜战场到持续学习:AI声呐带来的技术启示



    
收藏 IP: 111.200.200.*| 热度|

7 周健 彭真明 钱大鹏 池德龙 蒋大和 钟炳 雒运强

该博文允许注册用户评论 请点击登录 评论 (7 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-8-13 07:08

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部