2026年10月1日 · 星期四
| 主题 | 检索期刊 | 收录论文数 |
|---|---|---|
| AI大模型 | Artificial Intelligence in Medicine、Journal of Biomedical Informatics、Computer Speech & Language | 6 |
| 供应链金融 | Borsa Istanbul Review、Review of Accounting and Finance、Journal of Commodity Markets | 4 |
| 品牌 | Tourism Management Perspectives、Journal of Current Issues & Research in Advertising、Journal of Place Management and Development | 6 |
| 合计 | 9 本 | 16 篇 |
注:本期 9 本期刊均检索到 2025—2026 年相关文献;文献元数据(作者、卷期、页码、DOI、摘要)经 OpenAlex、Crossref 核对。
研究用 120 个临床病例测试 10 款大语言模型,发现仅追加一句“你确定吗?”质疑,整体诊断准确率即由 51.8% 降至 42.2%,改对为错(544 次)远多于改错为对(198 次),且 Claude Sonnet 4 的准确率翻转率最高(58.6%)。作者据此提出,临床部署前的模型评估必须报告“首轮准确率 + 有害翻转 + 有益纠正 + 质疑下的稳定性”四项指标。
随着医生将大语言模型(LLM)引入临床实践,其诊断准确性日益受到关注。本研究测量了在“确定性质疑”或“临床专科框架”提示后,LLM 诊断正确性的变化。研究构建了 120 个公开临床小案例(40 个来自 MultiCaRe 的临床叙事、80 个来自 MedMCQA 的考试型病例),对 10 款闭源与开源权重 LLM 在四种提示条件下各进行三轮、每条件两轮测试,共获得 28,800 条回答,并采用“LLM 作为评判者”的方法评估诊断正确性。结果显示:中性基线条件下准确率因模型而异,MultiCaRe 普遍低于 MedMCQA;GPT-5 的基线与质疑后准确率最高(74.4% 与 75.3%);Claude Sonnet 4 的准确率翻转率最高(58.6%),质疑后准确率损失最大(-36.4 个百分点)。在所有中性模型—病例组合中,基线准确率在“你确定吗?”质疑后由 51.8% 降至 42.2%(准确率翻转率 32.8%),由对转错的次数(544 次)远多于由错转对(198 次)。专科背景提示带来的变化较小:相邻专科提示使总体准确率提高 2.8 个百分点,跨专科提示使准确率下降 1.2—1.8 个百分点。“你确定吗?”质疑是本研究中诊断不稳定性最强的来源,病例来源同样显著影响准确率。研究建议:临床部署前,LLM 诊断评估应报告首轮准确率、有害翻转、有益纠正以及在临床可信对话挑战下的稳定性。
遵循 PRISMA-ScR 的 69 项研究综述显示,临床 LLM 可解释性研究已由事后 XAI(17.4%)转向生成式与交互式解释(58.0%);但 75.4% 的研究使用闭源模型,而全部机制性分析都只能依赖开源模型,形成“透明度不对称”。作者据此提出三项监管优先事项:优先支持可独立验证的解释、优先选择可检视模型、在临床工作流中前瞻性验证解释。
临床大语言模型(LLM)越来越多地用于病历记录、诊断和决策支持,但其不透明的推理过程限制了临床医生信任、监管评估与安全部署。可解释性研究迅速扩张,但现有综述大多针对传统机器学习或通用领域 LLM。本研究遵循 PRISMA-ScR 开展范围综述,梳理参数量超过 10 亿的仅解码器临床 LLM 的可解释性方法,检索 PubMed、Scopus、Web of Science、ACM 数字图书馆与 arXiv(截至 2026 年初)。在纳入的 69 项研究中,LLM 原生的生成式与交互式方法占主导(58.0%,n=40),涵盖思维链推理、检索增强的证据引用与智能体式任务分解;内建式(by-design)方法占 24.6%(n=17),事后 XAI 方法占 17.4%(n=12)。全科医学是最主要的临床领域,诊断是最主要的任务。75.4% 的研究使用闭源模型,但所有机制性分析都依赖开源模型,揭示出一种“透明度不对称”:被部署最多的模型恰恰最不透明。尽管 59.4% 的研究对解释进行了定量评估,但指标尚未标准化,且很少评估忠实性。局部解释占主导,且没有任何研究在真实临床工作流中前瞻性评估解释。研究指出,临床 LLM 可解释性已转向流畅的生成式理由,但关于这些理由是否真正反映模型推理的证据仍然有限,并提出三项监管优先事项:优先支持可独立验证或逻辑审计的解释而非仅具表面合理性的理由;在需要监管留档的场景优先选择可检视模型;在规模化前于临床工作流中前瞻性验证解释。
面向两家韩国三级医院的 3,326 条本地放射检查名称,作者提出“语义分解 + 本体约束下的 LLM 选择”两阶段框架:候选召回阶段 recall@5 最高达 0.78 / 0.89,经 LLM 选择后最终 recall@1 达 0.70 / 0.81,比直接字符串映射高出 20 个百分点以上,表明把 LLM 推理约束在结构化选择任务上可有效抑制幻觉。
目标:开发一种本体驱动框架,通过将异构的本地放射检查名称分解为语义组件,并借助受约束的大语言模型(LLM)解析与选择,将其对齐到 LOINC/RSNA 放射学词典编码。方法:从韩国两家三级医院收集放射检查名称,使用带检索增强生成的 LLM 提示将其解析为语义组件,并与 LOINC/RSNA 放射学词典(2.80 版)对齐;通过基于本体的相似度打分量化解析组件与词典候选属性之间的对应关系并召回前 10 个候选,再由 LLM 在该候选集内完成选择。以放射科医师人工整理的黄金标准为参照,与直接基于词典编码名称的映射及传统相似度指标进行比较。结果:共分析 3,326 条本地检查名称。基于本体的映射在所有评价指标上均显著优于基于词典编码名称的直接映射:候选召回阶段,本体属性匹配在内部与外部数据集上的 recall@5 分别最高达 0.78 与 0.89,而直接映射仅为 0.51 与 0.47;经 LLM 选择后,本体方法的最终 recall@1 在内部与外部数据集最高达 0.70 与 0.81,比直接映射(0.48 与 0.50)高出 20 个百分点以上(p<0.001)。结论:将检查名称分解为本体化语义组件可稳健处理异构的本地术语,而将 LLM 推理约束于结构化选择任务可缓解幻觉并保持语义保真度;本体驱动的知识编码为放射检查名称标准化提供了可扩展且可靠的路径,支持跨机构互操作与影像数据二次利用。
作者提出 KACD 框架,在慢性下背痛因果图上比较原生 LLM、RAG 与 KG-RAG 三种知识配置,其中 KG-RAG + 分阶段提问的 F1 最高(0.697),显著优于纯数据驱动结构学习(0.396);跨配置看,知识系统与数据驱动模型的结合一致抬升了性能下限,说明知识增强可为复杂健康领域的因果建模提供决策支持。
目标:从观测数据中做因果发现受制于数据集的结构约束、因果逻辑的缺失以及领域外部知识的不足。本研究提出知识增强因果发现(KACD)框架,将数据驱动的结构学习与基于 LLM 的知识系统结合以克服上述局限,并以慢性下背痛(cLBP)为应用场景。方法:在三种复杂度递增的配置中评估 KACD——原生 LLM、引入检索增强生成(RAG)的 LLM,以及引入基于知识图谱的 RAG 系统(KG-RAG)的 LLM。每种配置均以临床推导并经专家验证的 cLBP 因果图为基准进行比较。因果查询采用分阶段的两步提示策略,分别询问合理性、统计关联性与时间先后性,其设计灵感来自领域专家在构建真值时所采用的方法。评价指标包括 F1、真阳性率、错误发现率与结构汉明距离。结果:采用合理性提示的 KG-RAG 取得最高 F1(0.697),优于标准 RAG(0.689)、原生 LLM(0.649)与纯数据驱动结构学习(0.396);但该结果依赖底层模型,使用不同 LLM 时 RAG 可能优于 KG-RAG。在所有知识系统配置下,分阶段因果提示均优于直接因果查询。将数据驱动的原型模型与任一知识系统结合,在各种提示策略与系统配置下都一致提升了各自单独使用时的性能下限。结论:LLM 驱动的知识系统能有效增强生物医学因果建模中的数据驱动因果发现,其中 KG-RAG 凭借跨文档综合与以实体为中心的检索表现更佳;这些发现支持 KACD 作为研究者在复杂、多学科健康领域构建因果模型的决策支持工具的潜力,但仍需进一步验证其实际应用效果。
研究以多模态语音模型 Whisper 做端到端发音错误检测与反馈生成:用二语语音数据全量微调后,其反馈文本质量已接近基于 LLM 的最优水平(G 值 0.52 对 0.54);若再让 LLM 依据错误音素位置的发音属性特征生成反馈,则可懂度与有用性显著提升,为计算机辅助发音训练提供了新路径。
本研究探讨大语言模型(LLM)在发音错误检测与诊断(MDD)系统中的潜在应用,该系统涵盖发音错误检测、反馈与诊断,而准确检测错误发音并给出全面有效的诊断是引导学习者纠正练习的关键。传统 MDD 研究需要为特定任务收集数据并训练类似语音识别所用的模型;且以往研究多关注错误类型识别而非给出具体发音指导,导致发音错误的文本反馈相对有限、内容不够丰富。LLM 近期的突破为发音学习带来新机会,其能生成流畅且具有教学价值的反馈,如解释错误类型、示范正确发音并提供个性化练习指导。本研究探索多模态语音模型在端到端发音错误检测与反馈生成中的潜力。实验结果表明,使用二语(L2)语音数据对 Whisper 模型进行全面微调,可提升其对二语语音的建模能力,从而提高发音错误检测准确率;该模型生成的反馈文本质量与当前基于 LLM 的最优水平相当(G 值 0.52,SOTA 为 0.54)。此外,研究提出一种基于 LLM、利用发音属性特征的发音错误反馈方法,LLM 通过分析错误音素位置的发音属性特征,有效提升了反馈文本的准确性与有效性。二语学习者对 LLM 反馈的评价显示,采用这些发音表征后反馈的可理解性与有用性显著提升。上述结果证实,通过增强学习者参与度并减轻教师负担,发音特征工程与策略性模型优化在计算机辅助发音训练(CAPT)系统中具有潜力。
论文构建融合知识图谱、图机器学习(GraphSAGE)与大语言模型(DeepSeek)增强的葡萄牙语开放信息抽取框架,端到端 F1 达 58.2%,人工评价一致性 Cohen’s Kappa 为 0.67,并将无效/错误抽取比例由上一版的 31.7% 大幅降至 6.6%,展示了图结构方法结合 LLM 在资源有限语言上的价值。
利用结构与句法细节等更丰富的信息可以提升自然语言处理任务(如开放信息抽取)的效果,对葡萄牙语等资源有限的语言尤为如此。知识图谱(KG)通过统一多种标注并支持图机器学习(Graph ML),提供了稳健的解决方案。本文提出面向葡萄牙语开放信息抽取的进阶框架,将知识图谱与图机器学习同大语言模型(LLM)增强相结合。框架采用三阶段流程:(1)从文本构建初始知识图谱;(2)谓词抽取;(3)主语/宾语抽取,后两者均使用 GraphSAGE 模型;当图机器学习预测缺失时,使用大语言模型(DeepSeek)进行增强,或用于精修与验证抽取结果。作者给出系统的两个版本并在葡萄牙语数据集上评估:自动(基于词)评价显示,最佳版本的谓词抽取 F1 为 64.9%,主语/宾语抽取 F1 为 89.7%,系统端到端 F1 为 58.2%。两名标注者对 51 个葡萄牙语句子(得到 100 个三元组)进行人工评价,达成较高一致性(Cohen’s Kappa=0.67);系统平均每句抽取 1.84 个三元组,其中 53.9% 被判定为正确。值得注意的是,该版本将无效/错误抽取从上一版的 31.7% 显著降至 6.6%,在保持抽取多个有意义三元组能力的同时提升了精确率。
基于 30 个国家的企业层面数据,研究以“印记假说”解释企业主动回避正规信贷的现象:非正规经历通过制度结构与合规行为两类印记显著提高企业的信贷自我配给倾向,且该效应在非女性领导企业、营商环境较弱国家及融资障碍严重的企业中更为突出,为金融包容性政策提供了需求侧证据。
尽管企业融资约束已被广泛研究,但信贷“自我配给”(主动回避正规信贷)受到的关注有限。本研究基于印记假说与 30 个国家的企业层面数据发现,非正规经历显著提高了企业回避正规信贷的可能性。该效应通过早期制度暴露形成的结构性印记与行为印记发挥作用:制度结构的正规性与合规行为都强化了企业的自我配给倾向,但未发现认知印记作为有效中介渠道的证据。异质性分析表明,该效应在非女性领导的企业中更强,在营商环境较弱的国家尤为明显;且在面临严重融资障碍的企业中效应最突出,说明回避动机强于优化动机。研究为新兴与发展中经济体融资行为的发展起源提供了需求侧证据,并为改善金融包容性提供了启示。
在波特战略竞争理论框架下,作者以“成本领先、聚焦、差异化”三个术语构建谷歌搜索量指数,并用 TVP-VAR 频域关联方法分析 2004—2025 年月度数据,发现地缘政治风险的影响集中于短期外溢,而油价在长期主导全球供应链动态;危机时期投资者关注的结构更敏感、更具反应性,可持续竞争优势有赖于战略框架与地缘风险、供应链能力的整合管理。
本研究从投资者关注视角考察供应链中断与地缘政治风险之间的关系,以波特战略竞争理论为框架,采用 TVP-VAR 频域关联方法并将油价纳入分析。为度量投资者关注,作者识别出“成本领先”“聚焦”“差异化”三个关键战略管理术语,并基于其搜索频率构建谷歌搜索量指数(GSVI),样本为 2004 年 1 月至 2025 年 9 月的月度观测。研究发现,地缘政治风险与供应链中断之间的关系随时间变化:地缘政治风险在短期内对系统产生最显著的外溢,而油价在长期成为塑造全球供应链动态的主导因素。相应地,地缘政治风险在短期与投资者关注相关联,而油价则在长期与全球系统和供应链相关联。此外,投资者关注在危机时期表现出更敏感、更易反应的结构。总体而言,要实现可持续的竞争优势,需要将传统战略框架与地缘政治风险及供应链能力的有效管理相结合;这三个维度的整合构成理解投资者关注动态的关键分析框架。
基于 33 个经济体 9,673 家制造业企业数据与动态 GMM 估计,研究发现处于比较优势行业的企业提供更少商业信用(新兴经济体尤甚),控制国别—行业异质性对解读商业信用的宏观决定因素至关重要;对华光伏贸易冲击的 DiD 检验进一步显示,受冲击企业更多转向应付账款而非应收账款,凸显供应商—客户关系在缓解融资约束中的作用。
目的:本文旨在考察行业层面的比较优势如何塑造企业对商业信用的使用,并突出新兴经济体与发达经济体企业之间的差异。研究分析了国别—行业异质性如何影响企业间融资,弥补了既有文献在宏观经济与企业层面决定因素之外的研究空白。方法:使用 33 个经济体 9,673 家制造业企业的企业层面数据,采用动态广义矩估计(GMM)处理宏观与企业层面控制变量以及实证估计的显性比较优势指标可能存在的内生性;并通过对中国光伏行业贸易冲击的双重差分(DiD)分析,进一步考察商业信用在财务稳定中的作用。发现:处于比较优势行业的企业提供更少的商业信用,在新兴经济体尤为明显,因为它们较少依赖提供信用来吸引业务。控制这种国别—行业异质性对于准确解读商业信用的宏观经济决定因素至关重要。贸易冲击分析显示,受影响企业更多使用应付账款而非应收账款,强化了供应商—客户关系在缓解融资约束方面的作用。原创性/价值:本文首次系统评估行业比较优势对商业信用策略的影响,创新性地将 IMF 金融发展指数引入商业信用研究,证明在考虑国别—行业异质性时该指标具有重要意义,并借助准自然实验为理解企业如何应对国际贸易冲击调整融资策略提供了新见解。
研究以 1998—2023 年数据和小波量对量方法刻画全球供应链压力、地缘政治风险与能源及金属市场的关系:供应链压力在多个时间尺度与分位点上均能预测大宗商品收益(极端压力期尤甚),地缘风险的影响集中于短中期,而油价长期主导;大宗商品因此兼具投资与分散化对冲的双重角色,可为风险管理与政策制定提供参考。
本文利用 1998 年 1 月至 2023 年 4 月的数据,考察全球供应链压力与地缘政治紧张对主要能源和金属市场的影响。为此,研究采用基于小波的量对量(Quantile-on-Quantile)估计方法,以刻画样本期内及不同市场条件下关系的时变特征。结果显示,全球供应链压力在不同时间跨度和分位点上均可预测大宗商品收益,在供应链压力极端时期尤为显著;相比之下,地缘政治风险的影响在短期与中期更为突出,表明投资者会据此调整能源与金属投资。论文还指出,大宗商品可兼具投资资产与分散化资产的双重角色,为全球供应链中断和地缘政治事件提供对冲。这些发现为风险管理、投资策略以及政策制定者的决策提供了有价值的见解。
混合方法研究(访谈 + 问卷)表明,生成式人工智能通过服务设计、服务期望与游客参与三条路径正向影响旅游品牌绩效,且拟人化起调节作用——类人属性越强,游客参与越有效;成果既丰富了旅游与品牌文献,也为旅游企业制定 GAI 战略提供实践指引。
生成式人工智能(GAI)对旅游业具有变革潜力,但其对竞争优势关键驱动因素——品牌绩效的影响仍缺乏研究。本研究以服务主导(S-D)逻辑、社会交换理论与恐怖谷理论为理论透镜,采用访谈与问卷相结合的混合方法,考察 GAI 对旅游品牌绩效的影响。质性主题包括 GAI 服务设计、GAI 服务期望、游客参与与品牌绩效,共同勾勒出 GAI 在旅游业中角色的整体图景。定量结果进一步表明,GAI 正向影响品牌绩效,证实其在旅游业中的影响;同时拟人化调节游客参与,即具有更强类人属性的 GAI 能更有效地吸引游客参与。这些见解丰富了旅游文献,并为旅游管理者制定涉及 GAI 的未来战略提供了实践指导。
通过情境实验与中国顾客调查,研究证实服务机器人与酒店品牌个性的一致性越高,顾客的品牌挚爱越强,顾客信任在其中起中介作用,互动质量起正向调节作用;研究提示酒店应将服务机器人部署与品牌个性战略对齐,以培育更深厚、更具韧性的顾客—品牌关系。
服务机器人在酒店业的应用规模持续扩大。既有研究更多关注机器人技术对个体心理、认知与行为的影响,对其企业品牌效应的探讨相对不足。本文通过情境实验与对中国顾客的调查,探讨服务机器人与酒店品牌个性的一致性对品牌挚爱的影响。结果表明:(1)服务机器人与酒店品牌个性的一致性会影响品牌挚爱,与低一致性相比,高一致性可带来更强的顾客品牌挚爱;(2)顾客信任在上述关系中起中介作用;(3)互动质量正向调节一致性对顾客信任与品牌挚爱的影响。这些结果不仅深化了对酒店业中机器人—品牌一致性如何塑造顾客—品牌关系的理解,也为酒店管理者提供可操作启示,引导其将服务机器人部署与品牌个性战略对齐,以培育更深厚、更具韧性的顾客—品牌关系。
在线调查(N=222)显示,叙事广告中体验到的悲伤程度越高,受众的品牌态度越积极,叙事涉入对这一效应起完全中介作用,且该效应在共情水平较低的个体中更强;研究把低唤醒负性情绪(悲伤)纳入叙事广告效果研究,凸显叙事涉入与个体差异的作用。
本研究考察叙事广告中体验到的悲伤与消费者说服效果之间的关系。在一项在线调查(N=222)中,参与者在观看一则将悲伤嵌入故事情节的广告后,评价其品牌态度与购买意愿。结果显示,叙事广告中的悲伤程度越高,品牌态度越积极;叙事涉入对这一效应具有正向且完全的中介作用。此外,该关系在共情水平较低的个体中更强。通过聚焦悲伤这一低唤醒的负性情绪,本研究推进了对叙事广告中情绪诉求的理解,并凸显了叙事卷入与个体差异在塑造消费者反应中的作用。
两项研究(调查 N=470、实验 N=248)表明,积极的 AI 总体态度直接提升品牌创新感知与品牌态度,消极态度则通过“操纵意图”归因起作用;品牌对 AI 使用的透明度具有正向主效应,并能缓冲消极 AI 态度对品牌态度的不利影响,提示品牌需在“创新乐观”与“避免触发抵触”之间取得平衡。
本研究考察一般性人工智能态度(GAAIS)如何塑造消费者对宣传其 AI 使用的品牌的评价。研究一构建了连接品牌创新感知、操纵意图感知、品牌态度与购买意愿的概念模型;研究二进一步检验品牌透明度对这些关系的调节作用。研究一基于美国消费者调查(N=470,受访者表示接触过使用 AI 的品牌),研究二采用实验(N=248),以虚构汽车品牌操纵 AI 使用透明度的高低(高/低/无)。结果显示:积极的 GAAIS 直接预测品牌创新感知与品牌态度,但不预测购买意愿;消极的 GAAIS 对这些结果没有直接影响。同时,品牌对 AI 使用的透明度对感知创新与品牌态度具有正向主效应,但负向调节消极 GAAIS 对品牌态度的影响。总体而言,本研究说明积极的 AI 态度驱动以创新为核心的评价,而消极的 AI 态度则通过操纵意图归因发挥作用。其管理启示在于:品牌成功可能取决于在消费者对 AI 创新潜力的固有乐观与避免触发持消极倾向消费者的抵触之间取得平衡。
论文提出以设计为导向的“地方特征框架(PCF)”,从自然、建成与社会三个领域对地方特征进行分类,为在视觉转化前系统识别与组织具有文化意义的“符号 DNA”提供结构化支架;多阶段混合方法开发与初步测试表明,该框架有助于参与式与战略情境下的早期认同开发,弥补了既有地方品牌模型在符号探索环节的支持不足。
目的:本文旨在提出“地方特征框架”(PCF)——一种以设计为导向的工具,从符号视角重构地方认同模型,以支持对具有视觉与文化意义属性的识别与组织。PCF 将地方特征划分为自然、建成与社会三个领域,用以结构化早期阶段的符号探究。方法:该框架通过多阶段、混合方法、设计主导的研究过程开发,包括对既有框架的比较综合、对精选国家意象的视觉分析,以及与从业者和设计专业学生的探索性测试。发现:研究表明 PCF 可作为结构化的研究支架,帮助设计师与地方实践者在视觉转化之前呈现、组织并反思地方特有的符号素材;初步测试表明其有助于参与式与战略情境中的早期认同开发。原创性/价值:尽管地方品牌研究已认识到符号的重要性,既有模型在识别和组织地方“符号 DNA”(可转化为符号形式的文化意义特征库)方面提供的结构化支持有限。PCF 通过提供可迁移的框架,架起概念性地方认同模型与符号探索之间的桥梁,为地方品牌研究贡献了设计导向的视角。
以意大利 Naturno 的“Vision 2030+”为案例,作者基于设计科学研究(DSR)三循环模型提出整合专家访谈、混合问卷、社交媒体分析与战略文件审查的多方法评估模型,发现当地在战略工具与社区倡议上与愿景高度一致,但公共传播与旅游治理仍有缺口,为地方品牌认同的迭代学习与适应性管理提供了可复用工具。
目的:本研究旨在应对在动态地方情境中随时间推移评估地方品牌认同实施情况的难题。以 Naturno 的“Vision 2030+”为案例,提出一个基于设计科学研究(DSR)的概念模型,用以评估预期的地方品牌认同如何通过治理、公共话语与利益相关者感知得以落实。方法:研究运用 Hevner 的 DSR 三循环模型,开发整合专家访谈、混合方法问卷、社交媒体分析与战略文件审查的多方法评估模型。该模型是 Botschen 等(2017)“地方品牌驱动的认同发展”(BIDP)框架的评估性延伸,针对原框架在结构化监测与适应性反馈方面能力不足的问题。发现:模型在 Naturno 的应用显示,当地在战略工具与社区倡议方面与愿景具有高度制度一致性,但也暴露出公共传播与旅游治理方面的缺口。该模型支持迭代学习,有助于对地方品牌认同进行更具适应性、更以利益相关者为依据的管理。原创性/价值:本研究具有双重贡献:一是通过引入评估维度扩展了 BIDP 框架,回应了地方品牌文献中缺乏系统评估品牌认同实施机制这一更广泛的空白;二是展示了 DSR 如何在管理情境中用于构建有理论依据、经实践验证的工具,以在动态、利益相关者众多的情境中管理地方品牌认同,对乡村与受旅游影响地区尤为相关。