首页 > 医疗新闻/ 正文

【醉翁之艺】区域阻滞的存在对基于大语言模型推荐的腹部手术术后镇痛策略的影响:一项使用真实患者数据的比较研究

来源 2026-08-12 21:38:58 医疗新闻

深度解析医学证据,lxfs.net为你支撑决策

术后疼痛管理是麻醉学实践的基本组成部分,对患者舒适度、术后恢复和并发症发生率产生较大的影响。目前指南提倡多模式镇痛策略,以尽量减少阿片类药物相关的不良反应,并强调区域神经阻滞技术在这一框架中的核心作用。在接受腹部手术的患者中,区域阻滞技术已被证明可以减少阿片类药物的需求,并带来更有效和更安全的术后疼痛控制。随着计算能力和数据处理能力的快速发展,人工智能(AI)在模式识别、预测和临床决策支持过程中发挥了越来越重要的作用。在围术期医学和麻醉学中,基于人工智能的决策支持系统已经在一系列应用中得到了研究,包括术前风险评估、术中血流动力学不稳定预测、气道管理、术后并发症估计和疼痛管理策略优化。这些系统通常不是作为自主决策者,而是作为辅助临床医生的辅助工具。因此,在产生术后镇痛建议时,基于人工智能的系统在多大程度上结合了关键的临床环境变量(如区域阻滞的存在与否)仍不清楚。现有的文献主要集中在人工生成的医疗建议的准确性或一致性上,而研究这些建议如何根据特定的围手术期干预而变化的研究仍然有限。来自土耳其Gaziantep医院麻醉和复苏科的学者Bahar Uslu Bayhan等通过一项前瞻性、观察性、比较研究对区域神经阻滞使用与否通过不同AI大模型产生的术后镇痛推荐意见比较不同镇痛策略的差异探讨AI大模型在术后镇痛诊疗中的意义。该研究结果发表于2026年4月的《BMC Anesthesiol》杂志中。

image.png

方法

研究设计和伦理批准:

本研究是在Gaziantep市医院麻醉科进行的一项前瞻性、观察性和比较性研究。研究方案经Gaziantep市医院非介入性临床研究伦理委员会批准(编号:312/2025;批准日期:2025年9月17日)。此项研究依据《赫尔辛基宣言》的原则和有关的国家条例进行。

入组前获得所有参与者的书面知情同意。在整个研究过程中严格维护患者的隐私,所有数据在分析前都是匿名的。

纳入标准:

  • 年龄≥18岁。

  • 接受择期腹部手术(开放或腹腔镜)。

  • 在全身麻醉或局部麻醉下进行的手术。

  • 可获得完整的围手术期临床资料。

  • 有计划的术后疼痛管理策略,使用全身性镇痛药,无论术后是否应用区域麻醉

排除标准:

  • 年龄< 18岁。

  • 由于精神或神经疾病无法提供知情同意。

  • 接受非腹部外科手术。

  • 手术完全在局部麻醉或镇静下进行。

  • 发生严重的术前或术中并发症,明显改变了计划的术后镇痛。

  • 围手术期数据不完整或不一致。

此外,由于意外的术后并发症或需要入住重症监护病房,术后镇痛计划被大幅修改的患者被排除在最终分析之外。

数据收集:

从患者病史、麻醉记录和医院电子病历系统中前瞻性地收集围手术期数据。人口统计变量包括年龄、性别和身体质量指数(BMI)。临床变量包括美国社会麻醉医师(ASA)的身体状况分类,合并症的存在和类型,以及手术方式(开放或腹腔镜)。麻醉相关变量包括麻醉类型,是否应用区域麻醉,以及实施特定类型的区域阻滞,如腹横面(TAP)阻滞,双侧TAP阻滞,腰方肌阻滞或竖脊肌阻滞。术后镇痛变量包括阿片类和非阿片类镇痛药的使用、阿片类药物的使用类型、阿片类药物的总剂量以及是否实施多模式镇痛策略。

基于人工智能的临床场景生成

对于每位患者,使用收集的围手术期数据生成匿名和标准化的临床场景。根据是否存在区域性阻滞将患者分为两组有神经阻滞组和无神经阻滞组。为了确保所有人工智能系统的一致性,临床场景以结构化和统一的格式准备。

AI系统和查询过程

使用三个基于语言模型的大型人工智能系统(ChatGPT、Gemini和Copilot)独立评估生成的临床场景。对于每个患者,分别从每个AI系统获得术后镇痛建议,并记录模型生成的原始文本输出。所有人工智能查询使用英语进行。每个AI系统对每个临床场景查询一次,以反映现实的一次性临床决策支持设置;避免重复查询,以防止随机变异性。

对人工智能输出没有进行编辑、提示调整或临床干预。人工智能系统产生的建议不用于临床决策,仅用于观察和比较研究目的。人工智能生成的术后镇痛建议使用三个公开的基于大型语言模型的系统:ChatGPT (OpenAI),Gemini (Google)和Copilot(Microsoft)独立评估生成的临床场景。所有查询均在2025年10月1日至10月31日之间进行. 在此期间,ChatGPT使用当时平台报告的GPT-4类模型,通过web界面访问,Gemini通过Gemini web界面(当前公开可用版本)访问,Copilot通过Microsoft Copilot web界面访问。

所有AI系统都在相同的预定义时间框架内使用相同的提示模板进行查询。据悉,在查询期间没有发生影响这些系统的重大公开宣布的模型更新。大型语言模型的专有性质限制了对详细的内部版本控制的访问;然而,在数据收集时,所有的分析都反映了最终用户可用的模型行为。所有AI系统均使用相同的预定义提示模板进行查询,该模板包含来自真实临床数据的患者人口统计信息、手术特征以及麻醉相关变量。这个提示在所有案例中均被统一应用,未作修改、提示升级优化或后续查询。完整的提示模板见附录1。

附录1:

image.png

评估人工智能产生的镇痛建议

通过两种互补的方法对人工智能系统生成的术后镇痛建议进行评估。

首先,通过将AI生成的建议与患者病历中记录的实际临床实践中实施的术后镇痛策略进行比较,开展一致性分析。这些真实世界的临床决策被用作一致性分析的唯一参考标准。 

其次,由两名至少拥有三年临床经验的麻醉科专家独立评估AI生成建议的临床合理性。评估者对AI系统的身份以及彼此的评估结果均保持盲态。在意见不一致的情况下,通过与第三位资深麻醉科专家协商达成共识。

AI生成的自由文本输出根据预设标准被转换为结构化变量。两名麻醉科专家独立对每项阿片类药物使用、多模式镇痛和区域神经阻滞的建议进行编码,将其作为二元结果(是/否)。明确的建议编码为“是”,而无建议则编码为“否”。总体临床适用性采用5分Likert量表进行评分,范围从1(完全不适用)到5(完全适用)。编码或评分上的差异由第三位资深麻醉科医生通过共识解决。

结果分析:

该研究的预定主要结局是人工智能生成关于术后阿片类药物使用的建议(是/否)。次要结果包括人工智能生成的多模式镇痛建议(是/否),包括将区域麻醉纳入术后镇痛计划(是/否),以及由麻醉专家使用5分制Likert量表评估的人工智能生成建议的总体临床适当性。

统计分析:

连续变量以均数±标准差或中位数(四分位数范围)表示,而分类变量以计数和百分比报告。组间比较对连续变量采用独立样本t检验或Mann-Whitney U检验,对分类变量酌情采用卡方检验或Fisher精确检验。

为了评估区域阻滞存在与否对AI生成的术后镇痛建议的独立影响,进行了多变量logistic回归分析。采用有序逻辑回归模型对专家评分进行分析。所有回归模型都根据年龄、性别、体重指数(BMI),美国麻醉医师协会(ASA)的身体状态分类和手术入路(开放vs腹腔镜),进行了调整,包括手术入路,以解释观察到的组间不平衡。为了进行敏感性分析,专家评定的Likert分数被分解为更广泛的序数类别(1-2 =低,3 =中等,4-5 =高度适当),以减少稀疏性并评估有序回归估计的稳健性。

在显示完全分离的结果中,应用带有自举置信区间的惩罚逻辑回归。使用一致性百分比、Cohen’s kappa系数、敏感性和特异性来评估人工智能生成的建议与专家临床决策之间的一致性,p值< 0.05被认为在所有分析中具有统计学意义。

样本量计算:

在研究计划阶段采用G*Power软件(版本3.1.9.7)计算样本量。在缺乏先验数据的情况下,对人工智能生成的术后镇痛建议的优势比进行可靠的先验估计,最初的计算是基于检测到适度的组间差异,alpha误差概率为0.05,统计能力为80%。基于这种方法,每组至少需要64名患者。考虑到大约10%的潜在数据损失率,它计划包括至少140名患者。

由于本研究的主要结局指标为双重有序变量,最终采用逻辑回归和有序逻辑回归模型进行分析,因此还依据多变量回归分析的既定推荐标准(包括每项变量的事件数考虑)评估了最终样本量的合理性。最终共纳入140名患者、且调整模型中包含有限数量的协变量(年龄、性别、体重指数、ASA体格状况及手术方式)的情况下,样本量被认为足以支持计划分析中稳健可靠的回归估计。

结果

患者流程图如图1所示。

image.png

图1:患者入组和分析的concont式流程图

本研究纳入了140名接受腹部手术的患者,其中70例为区域阻滞组,70例为无阻滞组。两组在基线人口统计学和临床特征方面均无显著差异(所有p > 0.05)。(表1) 区域神经阻滞组中开放性手术的比例显著高于无阻滞组(p = 0.027)。

image.png

表1:患者基本情况和临床特征

表2总结了局部神经阻滞对人工智能术后镇痛建议的调整效果。在某些模型中观察到的具有宽置信区间的极端比值比可归因于稀疏数据和完全分离,应被解释为反映确定性模型行为,而不是精确的效应大小估计。

image.png

表2:有无区域阻滞对人工智能生成的术后镇痛建议和专家评价的影响

在调整了年龄、性别、BMI、ASA评分和手术方式(开放与腹腔镜)后,区域性阻滞的存在与否与ChatGPT推荐的阿片类药物无相关性(aOR 0.57, 95% CI)0.26 - -1.24;p = 0.155),Gemini(aOR 1.13, 95% CI 0.46 -)2.79;p = 0.792)或Copilot(aOR 0.54, 95% CI 0.25-1.17; p = 0.117)。

相比之下,区域神经阻滞的存在对AI块的建议有显著影响。当已经使用神经阻滞时,ChatGPT不太可能推荐一个额外的神经阻滞(aOR 0.02, 95% ci 0.00-0.18;P < 0.001)。同样,Copilot也显示,在现有区域神经阻滞存在的情况下,推荐区域神经阻滞的可能性大大降低(aOR 0.15, 95% CI 0.03-0.73; p = 0.019)。

对于Gemini,观察到完全相反的情况:该模型建议对所有没有神经阻滞的患者进行区域神经阻滞,而当已经存在神经阻滞时,它很少这样做。由于缺乏结果变异性,经典逻辑回归无法拟合;因此,采用带自举置信区间的惩罚回归。

ChatGPT和Gemini的多模式镇痛建议无法建模,因为这两个系统在100%的病例中推荐多模式镇痛,因此没有结果可变性。(表3、4和5)。

针对多模式镇痛和区域阻滞建议较高的一致性与低或接近零的科恩κ值反映了高度不平衡的推荐模式和与kappa统计相关的良好描述的流行效应。人工智能生成的推荐与实际临床实践在不同镇痛领域之间的一致性存在差异:所有AI系统在阿片类药物使用方面的符合度较低,κ值接近零或为负;而多模式镇痛方面则表现出较高的原始一致性,但由于推荐几乎一致,特异性较低。对于区域阻滞建议,总体一致性较高,但κ值仍保持较低水平,表明推荐行为具有系统性,而非真正的决策层面的一致性。在区域阻滞建议中,Gemini系统显示出完全分离的情况,因此无法计算科恩κ值。

image.png

表3:人工智能生成的术后镇痛建议与专家临床决策。A.阿片类药物使用协议

image.png

表4:人工智能生成的术后镇痛建议与专家临床决策。B。多模式镇痛协议

image.png

表5:人工智能生成的术后镇痛建议与专家临床决策。C。区域神经阻滞推荐协议

结论:

本研究利用真实患者数据,评估了区域神经阻滞对择期腹部手术患者术后镇痛建议的影响,该研究基于大型语言模型的人工智能系统生成镇痛方案。研究结果表明,人工智能系统能够识别区域阻滞的存在;然而,这种响应在不同镇痛领域中的程度和临床意义存在差异。尽管区域阻滞的存在显著降低了进一步推荐区域麻醉的可能性,但并未独立影响阿片类药物的使用建议。此外,某些人工智能系统将多模式镇痛作为一种普遍适用的策略,但在根据患者或手术特异性因素进行区分方面存在一定的局限性。

醉翁之艺点评

人工智能的概念最早是由约翰·麦卡锡于1956年提出的,并从基于规则的系统发展到数据驱动和基于学习的模型。在这一演变的最新发展中,大型语言模型(LLM)因其解释自然语言输入和生成上下文敏感反应的能力而吸引了医学界越来越多的兴趣。在医疗保健领域,基于人工智能的应用程序为综合临床数据、风险分层和临床决策支持系统的开发提供了大量机会。然而,特别是在直接影响患者安全的临床决策过程中,人工智能生成的建议的可靠性、上下文意识和潜在风险仍然是持续争论的主题。本研究基于临床数据评估神经阻滞存在与否在腹部手术术后镇痛方案的AI推荐策略中的差异发现基于研究阶段的大模型版本所推荐策略在不同AI模型中结果并不统一,尤其在应用神经阻滞的前提下再次推荐神经阻滞区域镇痛的策略有不同意见,但对阿片药的使用和多模式镇痛策略相对有一致的意见。

该研究还提示区域阻滞的存在并未独立影响ChatGPT、Gemini或Copilot生成的阿片类药物推荐。在人工智能驱动的围手术期疼痛管理领域,以往的研究主要聚焦于利用多变量临床数据集和复合风险因素来预测术后疼痛结局或持续使用阿片类药物的情况。因此,将干预措施特定变量(如区域阻滞的应用)自动转化为与阿片类药物相关的推荐,可能并不总是可预期的。在我们的多变量分析中,尽管存在区域阻滞,但阿片类药物推荐模式未出现显著变化,这表明人工智能系统可能更优先考虑手术特征、患者相关因素或整体疼痛管理原则,而非针对特定干预措施的镇痛策略。该研究也提示当前的人工智能系统在制定术后镇痛方案时,并未死板的采用以区域麻醉为中心、减少阿片类药物使用的策略。此外,人工智能生成结果依赖于基于相关性的模式识别,再加上在捕捉细微临床指南和情境细节方面可能存在不一致,可能导致针对不同病例的阿片类药物使用策略优先级出现差异。

在分析多模式镇痛建议时,ChatGPT和Gemini均未表现出统计学上的差异,因为这两个系统在所有病例中都一致推荐采用多模式镇痛策略。这一模式表明,这些人工智能系统将多模式镇痛视为当代指南中普遍认可的标准做法,对患者或手术特异性差异的敏感性有限。与这一解释一致,现有文献显示,基于人工智能的疼痛管理决策支持系统通常提供以指南为基础的、通用化的建议,仅在有限程度上反映患者的个体差异。尽管Copilot在多模式镇痛建议方面表现出更大的差异,但该差异未达到统计学显著水平。

综合来看,这些研究结果表明,AI系统在术后镇痛方案规划中表现出一定程度的上下文感知能力;然而,这种感知并未始终与现实中的临床决策保持一致。人工智能系统在区域麻醉等显著临床干预方面似乎展现出更一致的决策模式,但在涉及阿片类药物使用和多模式镇痛策略等更为复杂的临床实践领域时,则难以充分捕捉到临床实践的多样性。

该研究是在大数据背景下第一个基于真实世界的患者数据和常规临床实践,评估区域神经阻滞对择期腹部手术患者术后镇痛建议的影响的比较研究。虽然结果和专家推荐意见稍有不足,但随着大数据的升级完善,今后大数据在术后镇痛的临床应用前景仍然有很大的前景。尤其对于老龄化社会的到来,精准麻醉的理念对麻醉及术后镇痛的要求越来越高。基于此理念,未来的术后镇痛的实施在结合AI模型的推荐意见可能可以做到更加精准。

参考文献

Uslu Bayhan B, Gazioğlu Kişi T. The impact of regional block presence on large language model-based postoperative analgesia recommendations in abdominal surgery: a comparative study using real-world patient data. BMC Anesthesiol. 2026 Apr 10;26(1):316. doi: 10.1186/s12871-026-03814-y. PMID: 41957712; PMCID: PMC13188664.

阅读全文

小提示:本篇资讯仅在梅斯医学APP中开放阅读,请扫描二维码直接下载APP

-->

Tags: 【醉翁之艺】区域阻滞的存在对基于大语言模型推荐的腹部手术术后镇痛策略的影响:一项使用真实患者数据的比较研究  

搜索
网站分类
标签列表