一、定义与学科定位
计算语言学(Computational Linguistics)是通过建立形式化的数学模型,来分析、处理自然语言,并在计算机上用程序实现分析和处理过程,从而达到以机器来模拟人的部分乃至全部语言能力目的的交叉学科。 它涉及语言学、计算机科学和数学等多个领域。 计算语言学有时也称作自然语言处理(Natural Language Processing)、自然语言理解(Natural Language Understanding)或人类语言技术(Human Language Technology)。
作为一门横跨文科、理科和工科三大领域的交叉学科,计算语言学具有明显的跨学科性质。 其核心目标包括实现自然语言的自动理解与生成,以及开发机器翻译、信息检索、语音识别等应用系统。 从学科定位来看,计算语言学常与自然语言处理(NLP)混用,但二者侧重有所不同:计算语言学偏理论建模,而自然语言处理偏工程实现。
二、发展历程
2.1 萌芽期(1950年代)
计算语言学始于20世纪50年代的美国,源于机器翻译研究。 当时美国出于冷战需要,希望利用计算机将大量俄文科技文献翻译成英语,于是开发了机器翻译系统。 1956年达特茅斯会议标志着人工智能的诞生,计算语言学也成为人工智能的核心分支。
2.2 规则期(1960s–1980s)
随着机器翻译难以立即产生精确翻译,人们认识到人类语言的自动处理远比想象中复杂。 这一阶段以乔姆斯基的生成语法为代表,依赖人工编写的语法规则,但存在复杂度高、鲁棒性差等问题。 60年代开发的自然语言理解系统大多没有真正意义上的语法分析,主要依靠关键词匹配技术来识别输入句子的意义。 进入70年代以后,一批采用句法—语义分析技术的系统脱颖而出,如LUNAR、SHRDLU和MARGIE系统。
2.3 统计期(1990s–2010s)
1990年8月,第13届国际计算语言学大会上首次提出了处理大规模真实文本的战略目标。 统计与机器学习方法在自然语言处理中逐渐占据主导地位,语料库语言学兴起,统计机器翻译、词性标注等任务得以落地。
2.4 大模型时代(2018至今)
近年来,深度学习的发展进一步强化了数据的作用,预训练语言模型(如BERT、GPT)的出现实现了通用语言理解与生成,催生了ChatGPT等应用。 目前,深度学习方法几乎被应用于计算语言学研究的所有领域。
三、研究的基本问题
计算语言学几乎涵盖了语言学研究的所有层次:
| 层次 | 研究内容 |
|------|---------|
| 语音学 | 研究词和其相应的语音如何相关联,在基于语音的应用系统中至关重要 |
| 形态学 | 研究词如何由意义的基本单位——词素构成,计算形态学研究如何将词分析为词素的组合 |
| 语法学 | 研究词如何组合成正确的语句,以及语句的组成结构 |
| 语义学 | 研究如何从语句中的词的意义以及语法结构推导出语句的意义 |
| 语用学 | 研究不同上下文中的语句的应用,以及上下文对语句理解的影响 |
计算语言学主要研究以下实际问题:
- 计算机形态分析:将词分析为词素的组合,从而导出词的意义
- 计算机语法分析:根据语法规则推导语句的所有可能的语法结构
- 计算机语义表达:将语句意义形式化地表达出来,使计算机能够进行推理
- 计算机文本生成:从意义的形式化表达出发,由计算机产生语句
- 语言的歧义研究:从众多语法结构中挑选出最合适的结构
- 计算机语言学习:通过机器学习自动获得语言处理所需的知识
四、研究方法
计算语言学的研究方法经历了从理性主义到经验主义的演变。 理性主义方法基于语言规则,强调人工编写语法规则;经验主义方法则基于语言大数据,通过统计和机器学习从数据中学习语言规律。目前,深度学习作为经验主义方法的主流,几乎应用于所有领域,但学者们普遍认为,深度学习应当与语言学研究结合起来,实现经验主义与理性主义的相互促进。
五、应用领域
计算语言学的应用范围非常广泛,主要包括:
- 机器翻译:谷歌翻译、DeepL、百度翻译等
- 语音交互:Siri、小爱同学、讯飞语音等
- 文本生成:ChatGPT、文心一言等AI写作助手
- 信息处理:舆情分析、情感分析、文本摘要、智能客服
- 自动文摘:从文本中提取关键信息生成摘要
- 信息检索:互联网上的智能搜索
- 文字自动识别:光学字符识别(OCR)
- 计算机辅助教学:智能批改、个性化学习
六、学科发展现状
6.1 前沿热点
当前计算语言学的前沿研究主要集中在:
- 预训练语言模型:融入多模态信息和结构化知识
- 模型效率改进:降低深度学习框架下的训练复杂度
- 中文为核心的知识挖掘:结合中文特点开展研究
6.2 专业建设
2026年,教育部发布的本科专业目录中新增了计算语言学专业。 此前,该方向在我国多所高校的研究生培养阶段已有开展,此次纳入本科专业意味着该专业在国家战略和社会需求方面的重要性提升。 华东师范大学设立了全国首个计算语言学本科点,由文学院与信息学院联合培养。
6.3 人才培养
计算语言学专业的课程体系通常涵盖三大板块:
1. 语言学基础:语音学、音系学、形态学、句法学、语义学等
2. 计算机与数学基础:数据结构、算法、机器学习、统计学、信息论等
3. 计算语言学核心:语料库与知识库、语言信息处理技术、大语言模型、多语言信息处理等
***
总结:计算语言学是连接人类语言与机器智能的桥梁,从早期规则到统计再到深度学习,不断推动机器理解与生成语言的能力逼近人类水平,是人工智能时代最具活力的交叉学科之一。
转载本文请联系原作者获取授权,同时请注明本文来自李升伟科学网博客。 链接地址: https://blog.sciencenet.cn/blog-2636671-1544443.html
上一篇:
语言和心理概论! 下一篇:
教育心理学概述! 欢迎参加科学网十佳博文评选活动! 主办单位: 支持单位: