科研动态|我院2021级本科生伍治西在《灾害学》发表论文: 让AI读懂震后“求救声”

发布人:黄荣 编辑:张耀中

前言

       近日,我院21级本科生伍治西以第一作者身份,在《灾害学》发表论文《震后网络信息分析的轻量化 BERT-CRF 模型构建及应用》。研究面向地震后社交媒体中数量庞大、表达碎片化的网络信息,构建了融合时间特征的轻量化文本-时间双向编码随机场模型 TTBCM,让模型更高效地识别“地点”和“需求”,并进一步揭示震后舆情的三阶段响应模式。

01 从一个方向,到一篇论文

       这项工作始于 2023 年,伍治西跟随沈旭章教授开展大学生创新创业训练项目。研究方向得益于沈老师的提出,真正动手后,伍治西很快发现:地学问题是研究的出发点,但要让机器读懂震后文本,还需要使用NLP(自然语言处理)技术,跨进机器学习和人工智能的世界。于是,科研过程像一次跨学科“填图”:ACL 等自然语言处理顶会论文提供坐标,网络信息智能化提取、分词标注、深度学习和模型评估构成一层层需要补齐的“地层”。方向并没有一步变成论文,而是在阅读、学习、试验、回看问题的循环中,逐渐从一个宽泛主题收敛成一组可执行、可验证的研究目标。对于伍治西来说,这段科研经历的关键词不是突然有了一个模型,而是把一个问题拆小、把一块知识补齐、再把一个目标落地。最终,代码、实验和地学解释共同“生长”成了文章。

02 研究背景:当“信息洪流”撞上震后黄金时间

       地震发生后,社交媒体往往比许多正式报告更早出现现场线索:有人发布受灾地点,有人描述道路和房屋状况,也有人发出物资、医疗或安置需求。但这些信息通常混杂着口语、缩写、表情、转发和重复内容,像一股高速涌来的“信息洪流”。对人工研判而言,逐条阅读耗时;对传统算法而言,噪声、实体边界和时间变化又构成了多重挑战。研究因此聚焦一个具体问题——能否让 AI 在有限算力下,既读懂一条微博“在说什么”,又知道它“发生在震后的什么时候”,从而更快提取地点与需求等关键信息?

03 研究方法:让AI听见“哪里”和“需要什么”

       研究选取新疆乌什 7.1 级地震和台湾花莲 7.3 级地震为案例,采集震后 45 h 内的微博数据。乌什地震数据包括原创微博 1,382 条、评论 4,704 条;花莲地震数据包括原创微博 500 条、评论 6,346 条。原始字段包含发布内容、用户信息、IP 属地、时间戳及转发/点赞等传播指标,并对用户身份信息进行匿名化处理。经过文本清洗、时间编码和自动标注,研究标记地点实体(LOC)与需求实体(REQ)。例如,在“乌什急需救援物资”中,模型需要识别“乌什”对应地点,“急需救援物资”对应需求,同时保留词语之间的顺序关系。

图1  BertTokenizer工作流程

04 研究模型:如何“瘦身”,又不丢掉时间感

       论文提出Text-Time BERT-CRF Model(TTBCM),它不是简单把BERT与CRF相连,而是在语义序列之外加入时间分支,将微博发布时间换算为相对震中时刻的小时差,在 0-45 h 范围内归一化,再投影为与BERT隐层相同维度的时间向量。文本与时间拼接后,经两层融合网络交互,最后由分类器和线性链CRF完成全局最优解码。

       BERT:读上下文,理解“乌什”“急需”“医疗物资”在句子里的语义。

       时间编码:给模型一块“震后时钟”,区分第 1 h 与第 20 h 的信息语境。

       CRF:学习标签之间的合法转移,减少实体边界和序列组合错误。

       为了降低计算负担,研究将 12 层 Transformer 的中文 BERT 压缩为 4 层学生模型,结合知识蒸馏与领域自适应微调,使参数量降至标准 BERT 的约 25%。在 CRF 层中,模型进一步利用 B-LOC→I-LOC、B-REQ→I-REQ 等标签转移约束,增强震后口语化文本中的实体边界判断。

图2  TTBCM 网络结构示意图

05 模型评估:不把准确率高等同于“万事大吉”

       在 8:2 的训练集与验证集划分下,TTBCM 在 66 个 Epoch 内表现出稳定收敛趋势。与标准 BERT-CRF 的约 110 M 参数相比,TTBCM 为 28 M;推理速度整体提升约 2-3 倍,更适合资源受限与强调时效的应用场景。模型在乌什与花莲地震数据集上的准确率分别为 0.99 和 0.98,F1 分数分别为 0.80 和 0.82。模型的高准确率说明模型对大量样本的总体判断较稳,但 F1 相对较低,反映在类别不平衡、噪声和碎片化表达下,少数类实体仍存在漏检。

图3  TTBCM模型训练损失曲线
图4  乌什、花莲地震测试集的准确率与F1分数

06 研究发现:从曲线到应急节奏——震后舆情呈现三阶段

       模型不仅回答“文本里有什么”,还把识别出的地点与需求实体放回时间轴。以乌什地震为例,需求实体在震后第 1 h 内迅速达到高峰;地点实体则呈现延迟增长,在约第 20 h 达到峰值。两类信息的先后变化,对应着舆情关注从紧急诉求向空间定位、信息核实与恢复重建的转移。

图 5  乌什地震后 45 h 内地点与需求命名实体的变化曲线

       0-3 h|精准聚焦阶段:“乌什县”等震中定位与“急需物资”等诉求并行高发,网络信息集中反映震中位置和紧迫需求。

       3-20 h|范围扩散阶段:地点实体由核心震中向周边县市扩散,需求由基础物资逐步延伸至医疗救援,体现救援调度与多类型援助的协同推进。

       20-45 h|多元平稳阶段:地点与需求实体密度整体趋缓,后期重建、安置与心理援助等需求持续出现,舆情逐步从紧急响应转向恢复重建。

图 6  乌什地震实体聚类:左为地点实体,右为需求实体

07 研究意义:让关键线索更早浮出来

       TTBCM 的直接价值,是在较低算力下从震后碎片化文本中快速提取地点与需求,为应急人员筛选信息、理解需求变化和安排后续核查提供辅助。三阶段响应模式则提供了一种可量化的观察框架:不同时间段,网络信息中最值得关注的实体与任务并不相同。但是,研究也具有一定的局限性,数据规模受平台接口开放性与地域覆盖影响,目前主要验证中文微博,跨平台、跨语言泛化仍待检验,同时类别不平衡和长尾实体会影响召回率。未来工作将继续从多语言、多模态数据,领域知识驱动的稀疏标签增强,以及跨语言迁移学习等方向推进。

08 AI+地学,大有可为

       地学观测的对象,正在从仪器记录、遥感影像和空间数据,延伸到持续生成的人类活动信息。社交媒体不是地震仪,也不能替代现场核查,但它可以成为一种补充性的“人类感知层”:AI 负责在海量文本中发现线索,地学知识负责判断场景、机制与风险,应急体系负责把信息转化为行动。从灾害文本识别到多模态灾情研判,从地质灾害知识图谱到智能预警,从遥感解译到应急资源调度,AI 与地学的交叉远未抵达终点。真正值得期待的,不只是模型更大,而是模型更懂地学问题、更贴近真实场景,也更清楚自己的适用边界。

       研究得到国家重点研发计划(2025YFF0811600)和国家自然科学基金(42230305)联合资助。论文第一作者为伍治西,通讯作者为沈旭章教授。

 

论文信息:

       伍治西,沈旭章. 震后网络信息分析的轻量化BERT-CRF模型构建及应用[J]. 灾害学,2026,41(2):1-9.[WU Zhixi,SHEN Xuzhang,Lightweight BERT-CRF Model Construction and Application for Post-Earthquake Social Media Information Analysis[J]. Journal of Catastrophology,2026,41(2):1-9. doi:10.3969/j. issn. 1000-811X. 2026. 02. 001.]

 

供稿:伍治西

指导教师 通讯作者:沈旭章

编辑:张耀中

初审:董晓涵 梁秋芸

复审:郑义 徐永怡

审核发布:孔晓慧