[{"data":1,"prerenderedAt":23},["ShallowReactive",2],{"blog-detail-1027-zh":3},{"id":4,"date":5,"date_gmt":6,"modified":7,"modified_gmt":8,"title":9,"excerpt":11,"content":12,"featured_image":15,"categories":16,"tags":18,"sort_order":19,"focus_keyphrase":20,"seo_title":21,"seo_description":22},1027,"2025-12-02T16:40:03","2025-12-02T08:40:03","2026-08-13T14:28:21","2026-08-13T06:28:21",{"rendered":10},"[易学堂]AI 医疗建议的信任陷阱：不够准确却被高度信任？","\u003Cp>本次介绍的论文探讨了公众对AI生成的医疗建议存在显著过度信任现象：即使面对低准确性内容，非专业用户对其信任度与\u003C\u002Fp>\n",{"rendered":13,"protected":14},"\u003Cspan>本次介绍的论文探讨了公众对AI生成的医疗建议存在显著过度信任现象：即使面对低准确性内容，非专业用户对其信任度与医生建议相当，且更倾向于遵循潜在有害的指导，研究同时发现专家与非专家群体均受来源标签影响。这一结果提醒我们，AI生成的医疗建议目前仍只能作为辅助工具，不能替代专业医生的判断；除了提高准确率，理解患者信任AI建议的心理机制同样重要，尤其是在实际应用中，错误信息可能带来严重后果。尽管验证了跨平台一致性，但受限于GPT-3模型与样本年龄集中于年轻人，未来需通过前瞻性多中心研究验证结论普适性。\u003C\u002Fspan>\n\n\n\n\n\n\n\n\u003Cfigure class=\"wp-block-image size-full\">\u003Cimg decoding=\"async\" alt=\"图片\" class=\"rich_pages wxw-img fertsy-content-image fertsy-content-image--wide\" data-backh=\"289\" data-backw=\"578\" data-imgfileid=\"100000480\" data-ratio=\"0.5\" data-s=\"300,640\" data-src=\"https:\u002F\u002Fshengshengyi.com\u002Fwp-content\u002Fuploads\u002F2026\u002F07\u002Fwechat-ar2vqt359oykmfl5vi50pqpddq9wnq6kpugzyxdruhaoghpsdqzkoes9xdfj2mra-0-image-1.webp\" data-type=\"jpeg\" data-w=\"1000\" style=\"display:block;max-width:90%;width:90%;height:auto;aspect-ratio:1 \u002F 0.5;object-fit:contain;margin:24px auto;\" src=\"https:\u002F\u002Fshengshengyi.com\u002Fwp-content\u002Fuploads\u002F2026\u002F07\u002Fwechat-ar2vqt359oykmfl5vi50pqpddq9wnq6kpugzyxdruhaoghpsdqzkoes9xdfj2mra-0-image-1.webp\">\u003C\u002Ffigure>\n\n\n\n\u003Ch2>研究背景\u003C\u002Fh2>\n\n\n\n\u003Cspan>随着大型语言模型（Large Language Models, LLMs）不断发展，人工智能（AI）生成的医疗建议在在线问诊平台中被广泛使用。尽管这类模型具有快速、结构清晰的特点，其输出信息存在“幻觉”（hallucination）现象，即生成表面合理但事实错误的内容。过去研究主要聚焦于AI在医学考试中的表现或医生对AI辅助系统的态度，而非专业用户如何感知和信任AI生成的医疗内容，以及这种信任是否存在风险，仍缺乏系统证据。考虑到AI医疗建议可能影响用户健康决策，本研究通过三个实验系统评估了非专业用户对AI生成医疗回答的判断、信任度和行为倾向，并引入医生评价以揭示专家与公众的认知偏差。\u003C\u002Fspan>\n\n\n\n\u003Ch2>研究方法\u003C\u002Fh2>\n\n\n\n\u003Cspan>研究数据来源于在线医疗平台HealthTap的150个真实医患问答对，涵盖预防、症状、诊断等六大医学领域。利用GPT-3生成对应的AI回答，并由四名执业医师根据准确性将其分为高\u002F低两类：高准确性回答需至少三名专家评为“正确”，低准确性回答则多数为“可能正确”或“错误”。研究招募300名非专业参与者完成三项实验：实验一要求参与者区分医生与AI生成的回答，并评估其可理解性；实验二在盲态下评估回答的有效性、可信度、完整性及后续行为倾向（如遵循建议的意愿）；实验三通过随机标签（“医生”“AI”或“医生辅助AI”）分析来源标注对信任的影响。补充实验邀请六名医生参与盲审与非盲审，验证专家对AI回答的评估偏见。\u003C\u002Fspan>\n\n\n\n\u003Cfigure class=\"wp-block-image size-full\">\u003Cimg decoding=\"async\" alt=\"图片\" class=\"rich_pages wxw-img fertsy-content-image fertsy-content-image--wide\" data-backh=\"263\" data-backw=\"553\" data-ratio=\"0.475\" data-src=\"https:\u002F\u002Fshengshengyi.com\u002Fwp-content\u002Fuploads\u002F2026\u002F07\u002Fwechat-ar2vqt359oykmfl5vi50pqpddq9wnq6kpugzyxdruhaoghpsdqzkoes9xdfj2mra-0-image-2.webp\" data-w=\"1080\" style=\"display:block;max-width:90%;width:90%;height:auto;aspect-ratio:1 \u002F 0.475;object-fit:contain;margin:24px auto;\" src=\"https:\u002F\u002Fshengshengyi.com\u002Fwp-content\u002Fuploads\u002F2026\u002F07\u002Fwechat-ar2vqt359oykmfl5vi50pqpddq9wnq6kpugzyxdruhaoghpsdqzkoes9xdfj2mra-0-image-2.webp\">\u003C\u002Ffigure>\n\n\n\n\u003Ch2>研究结果\u003C\u002Fh2>\n\n\n\n\u003Cspan>参与者在判断AI或医生回答的来源时，准确率接近随机（约50%），信心评分也无显著差异，表明他们难以通过语言特征识别信息来源。语言学分析亦发现，AI与医生回答在字数、情感倾向、可读性等指标上无显著差异。\u003C\u002Fspan>\n\n\n\n\u003Cspan>在未知来源条件下，高准确性AI回答在有效性（95% vs. 医生81%）、可信度（4.26\u002F5 vs. 3.85\u002F5）和完整性（4.03\u002F5 vs. 3.55\u002F5）上显著优于医生回答。更值得关注的是，低准确性AI回答尽管存在错误，仍获得与医生回答相近的评价，且参与者表达出同样程度的采纳意愿。这一现象提示，低质量AI建议可能具有误导性，用户却难以察觉。\u003C\u002Fspan>\n\n\n\n\u003Cfigure class=\"wp-block-image size-full\">\u003Cimg decoding=\"async\" alt=\"图片\" class=\"rich_pages wxw-img fertsy-content-image fertsy-content-image--wide\" data-backh=\"335\" data-backw=\"578\" data-imgfileid=\"100000479\" data-ratio=\"0.5796296296296296\" data-s=\"300,640\" data-src=\"https:\u002F\u002Fshengshengyi.com\u002Fwp-content\u002Fuploads\u002F2026\u002F07\u002Fwechat-ar2vqt359oykmfl5vi50pqpddq9wnq6kpugzyxdruhaoghpsdqzkoes9xdfj2mra-0-image-3.webp\" data-type=\"png\" data-w=\"1080\" style=\"display:block;max-width:90%;width:90%;height:auto;aspect-ratio:1 \u002F 0.57963;object-fit:contain;margin:24px auto;\" src=\"https:\u002F\u002Fshengshengyi.com\u002Fwp-content\u002Fuploads\u002F2026\u002F07\u002Fwechat-ar2vqt359oykmfl5vi50pqpddq9wnq6kpugzyxdruhaoghpsdqzkoes9xdfj2mra-0-image-3.webp\">\u003C\u002Ffigure>\n\n\n\n\u003Cspan>来源标签对用户信任有显著影响。即使是相同内容，被标注为“医生”的AI回答可信度更高，而标注为“AI”时得分降低。专家评分也表现出类似偏差，在盲态下对AI回答的评价明显高于非盲态，说明标签不仅影响非专业用户，也能影响专业医生的判断。\u003C\u002Fspan>\n\n\n\n\u003Ch2>研究创新点\u003C\u002Fh2>\n\n\n\n\u003Cspan>本研究首次系统性揭示了非专业用户对AI医疗建议存在”准确性免疫”的信任偏差——即使面对低准确性内容，公众的信任度仍与医生建议相当，且更倾向于采取潜在风险行为。通过将用户实验与专家盲审结合，研究创新性提出”来源标签”是调节信任感知的核心杠杆：当AI回答被标注为”医生”来源时，其可信度显著提升，这一效应在医学专家群体中同样存在。这一发现直接挑战了”提升模型准确性即可增强信任”的传统假设，提示医疗AI的设计需从单纯追求技术性能转向更复杂的感知心理学框架，尤其需关注标签披露机制与风险可视化策略。\u003C\u002Fspan>\n\n\n\n\u003Ch2>研究局限性\u003C\u002Fh2>\n\n\n\n\u003Cspan>尽管研究验证了跨平台一致性，但仍存在多维局限：首先，基于GPT-3的模型可能低估新一代AI（如GPT-4）的误导潜力；其次，受试者以年轻技术熟练人群为主，未能覆盖老年群体及医疗知识匮乏者，可能弱化实际风险程度；再者，实验设计的单轮问答范式无法模拟真实诊疗中的动态交互（如病史追问、症状演变追踪），可能高估AI在复杂场景下的可信度；最后，回顾性数据收集存在选择偏倚风险，极端医疗案例的缺失可能影响结论普适性。\u003C\u002Fspan>\n\n\n\n\u003Ch2>临床意义与展望\u003C\u002Fh2>\n\n\n\n\u003Cspan>本研究发现，公众对AI医疗建议的信任可能与其实际准确性严重脱节，这种”信任-准确性错位”在低质量内容中危害尤甚。未来应加强AI输出内容的验证机制，避免误导患者，并引入透明的可信度提示或风险分级系统。同时，应推动AI与医生协同使用，避免将AI视为独立替代者。政策制定也需规范平台内容来源披露，公众教育亦需提高用户对AI局限的认知能力，从技术、制度与教育多方面保障患者安全。\u003C\u002Fspan>",false,"https:\u002F\u002Fshengshengyi.com\u002Fwp-content\u002Fuploads\u002F2026\u002F07\u002Fwechat-ar2vqt359oykmfl5vi50pqpddq9wnq6kpugzyxdruhaoghpsdqzkoes9xdfj2mra-0-cover.jpg",[17],11,[],0,"AI 医疗建议的信任陷阱","AI 医疗建议的信任陷阱：不够准确却被高度信任？ | Fertsy","AI 医疗建议的信任陷阱：本文梳理相关背景、核心进展与行业意义，并介绍生生易在人工智能辅助生殖和IVF技术领域的实践。",1786874476380]