民用航空与安全工程

基于YOLOv8n-MAAI的火灾图像检测

  • 曲娜 ,
  • 时尚 ,
  • 张晗 ,
  • 魏文龙
展开
  • 沈阳航空航天大学 安全工程学院,沈阳 110136

曲娜(1979—),女,辽宁营口人,副教授,博士,主要研究方向为电弧故障、电气火灾检测和智能信息处理,E-mail:

收稿日期: 2025-02-28

  修回日期: 2025-04-30

  录用日期: 2025-05-02

  网络出版日期: 2026-06-15

基金资助

国家自然科学基金(61901283)

辽宁省自然科学基金(2023-MS-241)

Fire image detection based on YOLOv8n-MAAI

  • Na QU ,
  • Shang SHI ,
  • Han ZHANG ,
  • Wenlong WEI
Expand
  • College of Safety Engineering,Shenyang Aerospace University,Shenyang 110136,China

Received date: 2025-02-28

  Revised date: 2025-04-30

  Accepted date: 2025-05-02

  Online published: 2026-06-15

摘要

为提高复杂环境中火灾检测的准确率和效率,对YOLOv8n模型进行了多项改进,提出一种基于YOLOv8n-MAAI的火灾检测算法。首先,在主干网络YOLOv8n中引入了多头自注意力(multi-head self-attention,MHSA)机制,提高模型处理复杂场景的能力,进而提升了检测精度。其次,将YOLOv9模型中的ADown模块集成到YOLOv8架构中,通过轻量化设计策略减少模型参数数量,降低了计算复杂度。然后,引入自适应空间特征融合(adaptively spatial feature fusion,ASFF)机制改进检测头,形成了新的Detect_ASFF检测头,有效过滤冲突信息,提升了特征的尺度不变性。最后,采用Inner-MPDIoU损失函数优化训练过程,增强了回归结果的准确性并加速了模型的收敛速度。试验结果表明,改进后的YOLOv8n-MAAI算法模型检测精度为92.4%,召回率为93.6%,平均精度均值达到94.3%,优于原始的 YOLOv8n、YOLOv5s 和 YOLOv3-tiny等其他流行的检测模型。这些改进为火灾探测提供了更准确、更可靠的解决方案,为火灾预防和控制技术的进步提供了支持。

本文引用格式

曲娜 , 时尚 , 张晗 , 魏文龙 . 基于YOLOv8n-MAAI的火灾图像检测[J]. 沈阳航空航天大学学报, 2026 , 43(2) : 70 -76 . DOI: 10.3969/j.issn.2095-1248.2026.02.010

Abstract

In order to improve the accuracy and efficiency of fire monitoring in complex enviroments, an improved YOLOv8n model named YOLOv8n-MAAI for fire detection was proposed. Firstly,by incorporating a multi-head self-attention (MHSA) mechanism into the backbone network, the model’s ability to handle complex scenarios was enhanced, improving detection accuracy. Furthermore, the ADown module from YOLOv9 was integrated into the YOLOv8 architecture, reducing computational complexity through a lightweight design. The adaptive spatial feature fusion (ASFF) mechanism was introduced to form a new Detect_ASFF detection header, filtering conflicting information and improving feature scale invariance. Finally, the Inner-MPDIoU loss function was employed to optimize the training process, enhancing regression accuracy and accelerating model convergence. Experimental results demonstrate that YOLOv8n-MAAI achieves a detection precision of 92.4%, a recall rate of 93.6%, and a mean average precision (mAP) of 94.3%, outperforming both the original YOLOv8n and other popular detection models such as YOLOv5s and YOLOv3-tiny. These improvements provide a more accurate and reliable solution for fire detection, supporting advancements in fire prevention and control technology.

近年来,随着我国城镇化进程的持续推进,城镇民用建筑的数量呈现显著增长的趋势,建筑火灾的发生频率亦随之上升,成为一个日益凸显的问题。根据《中国消防年鉴》的有关数据统计,建筑火灾在我国火灾事故中所占比重大约为全部火灾总数的80%。如果城市民用建筑遭遇火灾,不仅会带来巨大的经济损失,还会对构建和谐稳定的社会秩序产生不利影响。
为了精确定位图像中火焰目标的具体位置,需要进行目标检测。目标检测方法的分类主要涵盖两大范畴:其一为基于回归的单阶段检测;其二为基于候选区域的双阶段检测1。单阶段目标检测算法是一种用于图像中物体检测的算法,具有代表性的检测框架包括YOLO(you only look once)系列2、SSD(single shot multibox detector)系列3及ConerNet系列等4。YOLO系列目标检测算法通过同步进行目标识别与边界框回归任务5-6,在保证检测精度的基础上,显著提升了检测速度,目前被众多学者应用于目标火焰检测领域7-9。李庆旭10在YOLOv4模型基础上引入自注意力机制,构建了SF-Net特征提取网络,可以迅速精确地识别出船舶机舱中的火灾。蔡鹏德11提出了一种基于YOLOv5的火灾烟雾优化检测算法,创新性地运用了K-means++算法,并对CBMA注意力机制的通道域进行了改进。Xu等12提出一种YOLOX-Swin模型,将火灾预警和火灾人员疏散相结合,建立完整的建筑火灾应急处置方案。Xu等13针对单个网络模型在复杂场景下特征提取的局限性,将YOLOv5和 EfficientNet两个模型并联协同检测火灾,虽提高了检测精度,但降低了检测速度。Zhang等14将YOLOv3网络与通道注意力相结合,增强了网络对火焰特征和烟雾特征的提取能力,但会忽略位置信息且无法建立远程依赖关系,导致部分信息丢失。针对航拍图像中小目标检测的难题,Yang等15提出的YOLOv7-BFAW模型展现出卓越的泛化能力和更优的检测性能。针对水下设备在复杂水下环境中面临的存储和计算能力有限的问题,Cen等16提出了一种基于YOLOv9的增强网络YOLOv9-YX,显著减小了模型计算量。
目前,YOLOv8在目标检测方面已经取得了很好的效果,但是在火灾检测等复杂环境中,仍然存在分辨率低、易受环境干扰等问题。本文选择YOLOv8的轻量版本YOLOv8n作为基本模型,提出了 YOLOv8n-MAAI 火灾检测算法。在主干网络中引入了多头注意力(MHSA)机制,通过多个注意力头并行处理不同的信息,提高了模型处理复杂场景的能力;用YOLOv9模型中提出的ADown模块取代了原有的Conv模块,有效地减小了模型中的参数数量,进而降低总体的计算复杂性;选用自适应空间特征融合(ASFF)机制,改进原有检测头以形成新的Detect_ASFF检测头,过滤掉了冲突信息,并提升了特征的尺度不变性;引入Inner-MPDIoU损失函数,替换了原始的CIoU损失函数,用于优化模型的训练过程,加速模型的收敛速度。

1 YOLOv8n-MAAI算法模型

1.1 MHSA

MHSA是一种基于自注意力机制的深度学习模型。其在处理输入序列时能够自动捕捉序列之间的依赖关系,从而更好地理解上下空间信息并提高模型性能。MHSA旨在增加模型的表达能力,为了更好地处理输入序列,通过线性变换将多组不同的查询、键和值映射到不同空间进行权重计算,得到最终的MHSA表示如式(1)、(2)所示。
h e a d i = A t t e n t i o n Q W i Q , K W i K , V W i V
M u l t i H e a d Q , K , V = C o n c a t h e a d 1 , h e a d 2 , · · · , h e a d h W O
式中:WQ、WK、WV为可以通过训练学习的参数。
MHSA的核心思想是将一个线性变换分成多个头,每个头执行自注意力操作,并将所有头的输出拼接在一起作为最终的表示。在自注意力操作中,每个头都计算出一个注意力矩阵,该矩阵对整个序列中不同位置所提供的信息加权并求和,从而得到每个位置的表示,MHSA整体结构如图1所示。其中:HW分别为输入特征图的高度与宽度;d为每个位置的向量维度;q r Tq k T分别代表内容与位置的交互及内容与内容的交互;RHRW 分别对应高度与宽度方向上的相对位置;两个分支content-content和content-position分别处理内容和位置信息。
基于以上分析,本文在YOLOv8n的主干网络中整合了MHSA,从而将原有的特征提取网络扩展至10层,据此进行了网络模型的优化,提高模型对物体的上下文信息感知能力,使模型专注于火焰信息,增加检测准确率。

1.2 ADown降采样模块

ADown模块是在YOLOv9模型中提出的一种卷积模块,用于目标检测任务中的下采样操作,对不同数据场景具有一定的学习能力。Adown网络结构如图2所示。本文将ADown模块加入到YOLOv8网络中,替换了原本的Conv模块。在Backbone部分,ADown通过在特征图的不同层之间进行下采样操作,有效提取特征图中的关键信息;在Head部分,其帮助进一步细化特征图的分辨率,以实现更精确的目标检测。ADown模块采用轻量化设计策略,有效减少了模型参数量,从而降低了整体复杂度。该模型在降低特征图的空间分辨率的同时,也注重保留尽可能多的图像信息,以便于模型能够更准确地进行目标检测。
图2 Adown网络结构

1.3 Detect_ASFF检测头

ASFF本质上是自适应地学习不同尺度特征的空间融合权重,其机制示意图如图3所示。ASFF包括两个步骤:等效重缩和自适应融合。等效重缩是指通过下采样或上采样操作,使得所有特征在空间维度上达到统一;自适应融合是指引入自适应的空间特征融合方式,可以有效滤除冲突信息,只保留有用的信息进行组合,缓解了不同特征尺度间的一致性问题。
图3 ASFF机制示意图
ASFF的优势在于其训练仅需通过反向传播的方式完成,与模型无关,且实现简单,增加的计算成本很小。本文将ASFF机制融合到YOLOv8网络结构中,改进其检测头,形成新的Detect_ASFF检测头。该机制有效地过滤冲突信息,提升了特征的尺度不变性,有助于提高火灾检测的准确性。

1.4 Inner-MPDIoU损失函数

损失函数的设计是影响模型性能的重要原因之一,而边界框损失函数是目标检测损失函数的重要组成部分。考虑到现有损失函数,CIoU的局限性,本文引入了MPDIoU损失函数,两种不同情况下的损失函数计算结果如图4所示。该函数通过直接计算预测框和真实框二者关键点之间的距离,并考虑两框之间的重叠区域、中心点距离及宽度和高度的偏差,提供更精确的损失度量方法。同时,为了更有效地提高火焰检测准确率,本文选择在MPDIoU基础上融合Inner机制。Inner-IoU专注于边界框内部的重叠部分,弥补了现有IoU损失函数在不同检测任务中的泛化能力较弱且收敛速度较慢的不足。
图4 两种不同情况下的损失函数计算结果
Inner-IoU通过专注于边界框的核心部分而非整体,为重叠区域提供了更精确的评估,从而显著提高了检测的精确度。因此, 采用Inner-MPDIoU损失函数替换原YOLOv8网络中的 CIoU损失函数,简化了两个边界框之间的相似性比较,可以适应重叠或非重叠边界框回归,优化了函数计算过程,有效提升了模型训练效果,从而提高了火焰检测的准确率。

2 火灾检测实验

2.1 数据集采集及预处理

本文数据集中的图像主要来源于网络上采集的火焰图片及火灾视频截图,涵盖了多数高楼建筑室内与室外火灾场景。为了提高数据集的多样性,还添加了少量森林、公路等不同场景下的火灾图片。通过翻转、平移、亮度调节、加噪等方法(如图5所示),实现了图像的数据增强,最终将数据集扩展至包含9 305张图片,划分为训练集与验证集,两者的比例设定为8∶2。
图5 数据集数据增强

2.2 实验平台配置

本次实验是在Windows 11的操作系统下进行,CPU型号为12th Gen Intel(R) Core(TM) i5-12500H@2.50 GHz,运行内存为16 GB,GPU型号为NVIDIA Ge Freo RTX3050,深度学习框架为Pytorch1.13.1, 运算架构为Cuda12.0,开发环境为Python 3.8.17。在训练过程中,设置输入图片尺寸为640×640像素,batch size为8,共进行100个epoch。

2.3 消融实验

为了更准确地分析不同改进部分对模型性能和火灾检测准确性的影响,本文进行了消融实验。通过对表1消融实验的数据进行分析可知,原始YOLOv8n算法P达到了91.3%,R为92.2%,mAP为92.3%。首先,在模型中引入MHSA机制(改进一),显著提升了模型的特征提取能力,使得模型P提升了0.2个百分点,R提升了0.3个百分点,mAP提升了0.5个百分点;其次,通过引入ADown降采样模块(改进二),实现了PR与mAP的全面提高,每项指标均提升了0.3个百分点;第三,将检测头替换为Detect_ASFF(改进三),同样使得各项性能有所提高,其中P提高了0.3个百分点,R提高了0.4个百分点,mAP提高了0.5个百分点;最后,在改进三的基础上,通过采用Inner-MPDIoU作为新的损失函数(改进四),进一步提高了边界框的回归精度,PR分别提高了0.3个百分点和0.4个百分点,同时mAP也进一步提高了0.7个百分点。经过上述一系列改进措施之后,相较于原始YOLOv8n算法,改进后的mAP提升了2个百分点,mAP50-95提升了3.1个百分点,证明了所提出网络模型的优越性能。
表1 消融实验 (%)
方法 注意力机制 降采样模块 检测头 损失函数 P R mAP mAP50-95
YOLOv8n × × × × 91.3 92.2 92.3 74.8
改进一 × × × 91.5 92.5 92.8 75.5
改进二 × × 91.8 92.8 93.1 76.0
改进三 × 92.1 93.2 93.6 76.1
改进四 92.4 93.6 94.3 77.9

2.4 对比实验

为全面评估本文所提出改进算法的性能优势,研究设置对比实验,将改进后的算法与目前广泛使用的目标检测算法YOLOv3-tiny及YOLOv5s进行详尽比较,对比实验结果如表2所示。从表2可以看出,与YOLOv3-tiny和YOLOv5s主流算法相比,本文改进算法在各项评估指标上都表现出更好的性能。通过对实验数据的全面对比,证明了该方法能有效地提高检测准确性,更好地适应火灾检测的应用需求,适合应用于火灾检测场景。
表2 对比实验结果
模型 P/% R/% mAP/% FPS/(帧·s-1 模型大小/MB
YOLOv3-tiny 87.7 91.5 91.5 71.6 23.2
YOLOv5s 91.1 92.1 93.0 88.6 15.5
YOLOv8n 91.3 92.2 92.3 97.1 6.8
本文算法 92.4 93.6 94.3 89.6 8.0

3 结论

本文针对在建筑等复杂环境中火灾检测分辨率低、易受环境干扰等问题,提出了一种基于改进YOLOv8n的火灾检测算法,结论如下:
1)针对YOLOv8n模型进行了多项改进,旨在提高其在火灾检测场景下的性能。首先,在主干网络中引入MHSA,提高了模型处理复杂场景的能力,进而提升了检测精度;其次,将YOLOv9模型中的ADown模块集成到YOLOv8架构中,通过轻量化设计策略减少模型参数数量,降低了计算复杂度;此外,引入ASFF改进检测头,形成了新的Detect_ASFF检测头,有效过滤冲突信息,提升特征的尺度不变性;最后,采用Inner-MPDIoU损失函数优化训练过程,增强了回归结果的准确性并加速了模型的收敛速度。改进后的YOLOv8n-MAAI模型P达到92.4%,mAP达到94.3%。
2)对改进后的网络模型进行了训练,同时设置了消融实验和对比实验,以进一步评估改进后的模型在火灾检测任务上的性能。相较于原YOLOv8n模型,改进后的YOLOv8n-MAAI模型P与mAP分别上升了1.1个百分点和2.0个百分点。与 YOLOv5s 、YOLOv3-tiny 检测模型相比分别提高了1.3个百分点和4.7个百分点,mAP分别提高了1.3个百分点和2.8个百分点。实验结果表明,改进后的模型在火灾检测任务中具有显著的有效性,提升了火灾检测准确率,为火灾预警和应急响应等领域提供了更为准确和可靠的解决方案。
[1]
Zhou T Yu Z T Cao Y,et al.Study on an infrared multi-target detection method based on the pseudo-two-stage model[J].Infrared Physics & Technology2021118:103883.

[2]
Redmon J Divvala S Girshick R,et al.You only look once:unified,real-time object detection[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition.Las Vegas:IEEE,2016:779-788.

[3]
Liu W Anguelov D Erhan D,et al.SSD:single shot MultiBox detector[C].Computer Vision- ECCV 2016.Amsterdam:ChamSpringer International Publishing,2016:21-37.

[4]
Liu L Ouyang W Wang X G,et al.Deep learning for generic object detection:a survey[J].International Journal of Computer Vision2020128(2):261-318.

[5]
Wu Z S Xue R Li H.Real-time video fire detection via modified YOLOv5 network model[J].Fire Technology202258(4):2377-2403.

[6]
张为,魏晶晶.嵌入DenseNet结构和空洞卷积模块的改进YOLOv3火灾检测算法[J].天津大学学报(自然科学与工程技术版)202053(9):976-983.

[7]
Jindal P Gupta H Pachauri N,et al.Real-time wildfire detection via image-based deep learning algorithm[M].Singapore:Singapore Springer,2021:539-550.

[8]
Ghali R Akhloufi M A Mseddi W S.Deep lear-ning and transformer approaches for UAV-based wildfire detection and segmentation[J].Sensors202222(5):1977.

[9]
李澎林,章军伟,李伟.基于光流改进与YOLOv3的烟雾检测方法[J].浙江工业大学学报202149(1):9-15.

[10]
李庆旭.基于改进YOLO算法的船舱火灾检测系统设计[D].武汉:华中科技大学,2023.

[11]
蔡鹏德.基于机器视觉的高大空间建筑火灾检测技术研究[D].淮南:安徽理工大学,2024.

[12]
Xu Z Dai T Q. Efficient fire-smoke detection and evacuation simulation from buildings based on YOLOX-Swin[J].Journal of Southeast University(English Edition)202339 (4): 372-383.

[13]
Xu R J Lin H F Lu K J,et al.A forest fire detection system based on ensemble learning[J].Fo-rests202112(2):217.

[14]
Zhang X B Qian K Jing K H,et al.Fire detection based on convolutional neural networks with channel attention[C]//2020 Chinese Automation Congress.Shanghai:IEEE,2020:3080-3085.

[15]
Yang J J Zhang X S Song C L.Research on a small target object detection method for aerial photography based on improved YOLOv7[J].The Visual Computer202541(5):3487-3501.

[16]
Cen Q Zhu Q G Wang Y X,et al.YOLOv9-YX:lightweight algorithm for underwater target detection[J].The Visual Computer202541(6):4033-4045.

文章导航

/