随着大型语言模型(Large Language Models, LLMs)不断发展,人工智能(AI)生成的医疗建议在在线问诊平台中被广泛使用。尽管这类模型具有快速、结构清晰的特点,其输出信息存在“幻觉”(hallucination)现象,即生成表面合理但事实错误的内容。过去研究主要聚焦于AI在医学考试中的表现或医生对AI辅助系统的态度,而非专业用户如何感知和信任AI生成的医疗内容,以及这种信任是否存在风险,仍缺乏系统证据。考虑到AI医疗建议可能影响用户健康决策,本研究通过三个实验系统评估了非专业用户对AI生成医疗回答的判断、信任度和行为倾向,并引入医生评价以揭示专家与公众的认知偏差。
参与者在判断AI或医生回答的来源时,准确率接近随机(约50%),信心评分也无显著差异,表明他们难以通过语言特征识别信息来源。语言学分析亦发现,AI与医生回答在字数、情感倾向、可读性等指标上无显著差异。在未知来源条件下,高准确性AI回答在有效性(95% vs. 医生81%)、可信度(4.26/5 vs. 3.85/5)和完整性(4.03/5 vs. 3.55/5)上显著优于医生回答。更值得关注的是,低准确性AI回答尽管存在错误,仍获得与医生回答相近的评价,且参与者表达出同样程度的采纳意愿。这一现象提示,低质量AI建议可能具有误导性,用户却难以察觉。来源标签对用户信任有显著影响。即使是相同内容,被标注为“医生”的AI回答可信度更高,而标注为“AI”时得分降低。专家评分也表现出类似偏差,在盲态下对AI回答的评价明显高于非盲态,说明标签不仅影响非专业用户,也能影响专业医生的判断。