Ceradata的个人博客分享 http://blog.sciencenet.cn/u/Ceradata

博文

AI时代的材料研究随想

已有 556 次阅读 2026-8-17 12:36 |个人分类:研究|系统分类:科研笔记

    随着AI的迅猛发展,借助大模型已成为材料研究的常态,从研究资料查询、整理,研究方案、技术路线的构建,到实验设计、数据处理及数学建模、编程实现几乎无所不能。材料研究因其涉及化学、物理、数学等基础学科和材料物理化学、材料工艺、测试技术、设备、计算机应用等专业知识,材料工作者的练就是极其不易的材料研究涉及化学、物理、数学等基础学科,以及材料物理化学、材料工艺、测试技术、设备应用、计算机开发等多领域专业知识,因此材料工作者的练就是极其不易,随着材料自身及其相关制备技术的不断发展,材料工作者的能力也必然要随之不断升级。AI大模型凭借其资料及知识的广博,随时更新,从基础学科到材料研发细节,大模型已成为材料工作者的高级助手AI大模型凭借广博且随时更新的知识储备,覆盖从基础学科原理到材料研发细节的全领域内容,早已成为材料工作者不可或缺的高级助手。

    材料工作者从古代的手艺人,到近代的材料工程师、材料学者,演变到将要到来的材料模型构建及应用者,这样的演变的内涵是再到未来即将转型成为的材料模型构建与应用者,这一演变过程的核心内涵在于:第一阶段,没有材料内在本质的科学认知,只是对材料制备过程的现象、经验的积累与传承,是口口相传的的“艺”。第二阶段,随着西方自然科学体系的建立及其在材料领域中的应用,对材料制备中的物理化学过程有了系统的认知,从材料“艺”上升到材料学阶段。我们可以用物理、化学的基本理论解释材料制备过程各现象的本质及其影响因素。对于材料制备过程涉及的基本物里物理过程,物理学家已给出非常完美描述物理学家已经给出了非常完美的描述,如陶瓷材料烧结过程、非氧化物陶瓷高温氧化过程的扩散,可以用完美的菲克定律描述。但是非常遗憾在教科书或相关研究论文中极少出现扩散方程及其微分方程的解的数学公式。这就是材料学的现状,这也是材料学必须进一步升级到第三阶段的原因。

    为什么,不能再进一步?因为,基础学科是以物质或物理现象本身为研究对象,而其纯净的模型用于复杂的材料出现很多问题为什么材料研究不能再进一步?因为基础学科是以物质或物理现象本身为研究对象,简化抽象出纯净的物理、数学模型,将该模型直接应用到复杂材料中时,就会出现很多问题。如氧化锆的晶型问题,在物理化学中已给出物质氧化锆的晶型与化学组成及温度的关系(热力学相图),但是,对于一个种氧化锆陶瓷材料来说,其氧化锆晶型还与原料粉体尺寸、烧成制度、致密度、烧成体的残余应力状态、晶粒尺寸等材料因素相关,甚至这些材料因素可能是决定性的。上述非氧化物陶瓷的高温氧化问题也是如此。如果SiC陶瓷的高温氧化与氧化时间呈线性关系,属于活性氧化,受表面反应控制;而氧化与时间呈非线性关系,则属于扩散控制过程,氧化形成的氧化硅产物层会阻碍进一步快速氧化。既然是扩散控制为什么不用菲克定律描述该过程,而是用没有物理意义的2次多项式?因为,对象不是纯物质,是SiC陶瓷材料!该陶瓷材料不仅有SiC的物质属性,还有晶界、晶粒等材料属性,这些用菲克定律中的一个扩散系数是无法表述的这些材料结构特征仅用菲克定律中的一个扩散系数是无法完整表述的。再加上非均质体系的菲克定律微分方程是没有解析解的。这些障碍将基础科学在材料学中的应用主要停留在定性或半定量的现状中。

    材料研究的本质就是揭示材料3要素,即组成、结构、性能(还可以加1个服役环境)的关系,关系可以是定性的,也可以是定量的。但是,我们揭示这种关系的主要目的是如何获得目标性能的材料,也就是说,该关系应能预测材料性能,并在此基础上优化获得该材料的工艺方法及其参数。能达到该目的的关系一定是定量模型。也就是说我们要建立一个从组成出发,经过材料工艺及条件,获得相应的材料结构,再建立组成、工艺条件与结构及性能的全链条关系模型也就是说我们需要建立全链条关系模型:从组成出发,结合材料工艺及条件得到相应的材料结构,进一步表征其性能,最终构建组成、工艺条件与结构、性能之间的关联。这种定量材料关系模型这就是材料发展的第3阶段的关键标志。在AI到来之前,我们已进行了大量的尝试,都没有成功,如建立专家系统、材料基因组计划等。材料基因组设想没问题,但是,路径是关键。比如按照我们材料学现阶段的模式,凡事到要从第一性原理出发,从原子、电子计算预测材料性能,我认为即使是多尺度计算也是非常困难的。AI的出现为我们提供了一个新的思路:从数据出发!随着大数据、机器学习的发展,使得材料研发直接从多维度的数据中整理、挖掘出材料各因素与性能的内在关系。也许有人会认为不含内在机理的黑箱模型只有工程价值,没有科学价值。材料本就是多物理化学过程综合作用的结果,其所谓机理用一个漂亮的微分方程自然是无法描述的,一个纯扩散过程对于材料来说都无法获得一个漂亮的解析解,更不要说多过程的综合效应。另一方面,通过模型的权重参数及数据结构分析是可以进行局域机理分析的。

    AI大模型的出现使得建立材料专家系统成为可能,可以将某材料的所有研究论文资料,无论是数值数据、图像、文字、甚至,甚至音像资料用于训练大模型,可以实现材料设计、制备的定性或半定量的技术指导。但是,现阶段的这种非定量模型还不能满足材料高效设计优化的需求,还是需要一个具体材料的定量小模型,这是我们材料工作者需要做的工作。AI及机器学习的高速发展已使得我们以前无法解决的材料定量模型的关键问题可以简单解决了。如多因素非线性数学模型形式问题、非数值数据的建模问题等。

    材料定量模型的建立过程不是简单将已有数据提交给AI大模型就能简单实现的问题材料定量模型的建立,不是将已有数据提交给AI大模型就能简单完成的工作,一定是在是材料工作者根据材料学的知识不断提示AI大模型如何建立、完善的过程。除此之外,AI材料定量模型还有大量的问题需要解决。

(1)多维交互作用数据。到目前为止,对于多因素的材料体系,基本都是采用单因素化法进行简化研究的到目前为止,针对多因素材料体系,研究中基本都采用单因素化法做简化处理。即将其他因素都固定,依次研究单一因素变化对性能的影响规律,再简单加和各因素的影响规律,作为对多因素体系的认知。显然,这样的数据完全不能包含多因素间的交互作用信息,用这样的数据是无法建立良好的多因素非线性定量模型的显然,这类数据提取多因素间的交互作用信息,因此也无法以此建立合格的多因素非线性定量模型。即使有一些正交实验正交试验等多因素实验数据,由于该方法的局限性,往往这往往只作为研究的初步实验手段,没有成为多因素研究数据的主流。因此,材料研究需要为了获取多因素同时变化的数据重新设计实施实验,这需要机器学习数据处理工具的帮助;

(2)高质量材料数据。材料是实验学科,其数据主要通过实验获取,而材料实验往往时间及经济成本较高,而AI建模往往需要的数据量较大,因此,建模数据成本很高。解决方法就是提高数据质量,即提高数据的信息含量,用较少的数据获得模型较高的精度。重要性抽样方法【1】是提高数据质量的实验设计方法:重要的地方要多抽样,而不重要的地方少抽或不抽。

(3)非数值数据的特征数值数据的提取非数值数据的特征数值提取。材料研究的数据除了强度、密度、气孔率等具有大小顺序的数值数据外,还有大量的无序的类别数据(如α相、非晶相、氧化铝、氧化锌等)、图谱、照片等非数值数据(XRD、XPS、SEM、TEM等),这些数据如果能够根据材料学知识提炼出信息含量较高的特征数值,将会大大提高模型训练效率和模型精度。这些提炼过程在AI大模型的帮助下,都是可以简单实现的,较复杂的编程现在也可以由AI代劳了,而无需购买昂贵的专业处理软件即便较为复杂的需要计算机编程处理的流程也可由AI完成,无需研究者购买昂贵的专业处理软件。

(4)优选适用于小数据样本的机器学习算法与模型结构。要根据材料数据少的特点,选择合适的机器学习算法,比较各算法的残差;更重要的是更具材料学的知识,分析数据间的相关关系,构建优化数据结构,而不是简单将所有因素为输入自变量,性能为输出因变量的扁平数据结构,这样可以降低模型训练对数据样本量的要求,甚至对于不同层次的数据间分模性模型,采用不同的机器学习算法;还可以通过因子分析对数据进行整合、降维等多维数据处理,解决材料因素多、数据少的问题。

总之,在材料研究AI升级过程中,材料工作者在AI的帮助下,还有大量的工作可做,必须做。

【1】张跃关于人工智能时代材料研究实验设计的思考现代技术陶瓷, 2024, 45 (1-2): 1-11



https://blog.sciencenet.cn/blog-3659757-1548269.html


下一篇:从宇宙起源对时空的直觉思考



    
收藏 IP: 114.243.119.*| 热度|

1 刘进平

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-9-3 15:50

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部