探索连续 28 天数字化心理健康练习在提升成年人心理健康的有效性
试验速览
- 阶段
- Unknown
- 状态
- 尚未招募
- 发起方
- 入组人数
- 400
- 试验地点
- 1
- 主要终点
- 抑郁自评量表
研究概览
简要总结
本研究旨在通过一项随机对照试验,检验参与者持续使用为期 28 天的数字化心理健康干预(由心理治疗聊天机器人 Nancy 提供)是否能够改善成年人的心理健康结局。此外,本研究还将评估参与者对该干预形式的使用体验与主观感受。在数字化心理治疗快速发展的背景下,本研究有望进一步推动人工智能在心理健康照护领域的应用。
研究设计
- 研究类型
- Interventional
- 主要目的
- 随机平行对照
- 盲法
- 本研究采用单盲设计。参与者在研究实施过程中不知道其他组别的具体干预方式,仅知晓自己将接受一项数字化心理健康干预,但不掌握完整的分组信息。研究过程中,不向参与者公开各组的具体设置及比较目的,以尽可能减少期望效应对研究结果的影响。
入排标准
- 年龄范围
- 18 至 35(—)
- 性别
- All
入选标准
- •1.年龄为 18-35 岁的成年人;
排除标准
- •1.当前存在伴有意图和 / 或计划的自杀意念,或存在急性自杀风险(由筛查评估结果判定);
- •2.当前或既往患有精神病性障碍(以参与者自报的临床诊断或正在接受精神病性障碍相关治疗为依据)。
研究组 & 干预措施
试验组(南希)
心理治疗聊天机器人“Nancy”基于 PsyLLM 进行训练,旨在改善成年人的心理健康福祉。PsyLLM 是一个面向心理咨询场景的领域专用大语言模型,使用由 MCTSr-Zero 生成的数据进行微调,并已表现出当前最先进的性能。MCTSr-Zero 是一种基于蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)的框架,通过引入领域对齐、再生成以及元提示词自适应等机制,提升开放式对话生成任务中的搜索效果。在基于 PsyEval 评估系统(共 16 个维度)的对比实验中,PsyLLM-Large 和 PsyLLM-Mini 分别取得了最高的综合得分(90.93 和 90.72),优于其他被评估的主流通用模型及面向心理健康场景的模型(Lu et al., 2025)。
与其他主要基于认知行为疗法(CBT)训练的心理治疗模型相比,PsyLLM 是在经由整合式、多模态治疗技能库增强的合成训练数据上进行微调的。该技能库包含 327 项心理治疗技能,用于训练生成式 AI 心理对话系统(Nancy)。该技能库覆盖认知行为疗法(CBT)、辩证行为疗法(DBT)、动机式访谈(MI)、接纳与承诺疗法(ACT)、焦点解决短期治疗(SFBT),以及心理动力学治疗和客体关系取向方法。该技能库赋予系统整合式、多模态干预能力,并能够将抽象理论转化为可执行的对话行为。每一项技能条目均包含清晰的定义、具体的“何时使用”线索(包括使用时机与触发条件)、分步骤的实施指导,以及具体示例。在试验期间,将对参与者施加两项约束。第一,我们将在参与者每日首次进入应用程序时施加最低使用剂量要求。具体而言,Nancy 组参与者在每日首次进入时,需至少完成 15 个对话轮次后方可结束当次会话。一个对话轮次被定义为:参与者发送一条消息,随后聊天机器人作出一次回应。第二,参与者将被要求将对话内容聚焦于心理健康相关主题(例如情绪困扰、心理健康科普相关问题或积极生活体验),而非与心理健康无关的询问(例如编程帮助或天气信息)。
干预措施: 心理治疗聊天机器人“Nancy”基于 PsyLLM 进行训练,旨在改善成年人的心理健康福祉。PsyLLM 是一个面向心理咨询场景的领域专用大语言模型,使用由 MCTSr-Zero 生成的数据进行微调,并已表现出当前最先进的性能。MCTSr-Zero 是一种基于蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)的框架,通过引入领域对齐、再生成以及元提示词自适应等机制,提升开放式对话生成任务中的搜索效果。在基于 PsyEval 评估系统(共 16 个维度)的对比实验中,PsyLLM-Large 和 PsyLLM-Mini 分别取得了最高的综合得分(90.93 和 90.72),优于其他被评估的主流通用模型及面向心理健康场景的模型(Lu et al., 2025)。 与其他主要基于认知行为疗法(CBT)训练的心理治疗模型相比,PsyLLM 是在经由整合式、多模态治疗技能库增强的合成训练数据上进行微调的。该技能库包含 327 项心理治疗技能,用于训练生成式 AI 心理对话系统(Nancy)。该技能库覆盖认知行为疗法(CBT)、辩证行为疗法(DBT)、动机式访谈(MI)、接纳与承诺疗法(ACT)、焦点解决短期治疗(SFBT),以及心理动力学治疗和客体关系取向方法。该技能库赋予系统整合式、多模态干预能力,并能够将抽象理论转化为可执行的对话行为。每一项技能条目均包含清晰的定义、具体的“何时使用”线索(包括使用时机与触发条件)、分步骤的实施指导,以及具体示例。在试验期间,将对参与者施加两项约束。第一,我们将在参与者每日首次进入应用程序时施加最低使用剂量要求。具体而言,Nancy 组参与者在每日首次进入时,需至少完成 15 个对话轮次后方可结束当次会话。一个对话轮次被定义为:参与者发送一条消息,随后聊天机器人作出一次回应。第二,参与者将被要求将对话内容聚焦于心理健康相关主题(例如情绪困扰、心理健康科普相关问题或积极生活体验),而非与心理健康无关的询问(例如编程帮助或天气信息)。
对照组 3(等待)
等待名单对照组(WLC)参与者在研究期间不接受任何干预,并将在 28 天后的 T1 时点获得相应干预的访问权限。
干预措施: 等待名单对照组(WLC)参与者在研究期间不接受任何干预,并将在 28 天后的 T1 时点获得相应干预的访问权限。
对照组 1(电子书)
电子书组参与者将阅读《情绪是什么》(How We Feel,Giovanni Frazzetto 著)中文版。该书是一部基于神经科学视角撰写的心理科普读物,系统阐释了主要情绪类型及其背后的脑机制,并结合研究证据与通俗易懂的现实案例,为参与者提供结构化的心理教育内容。该书曾被《卫报》评为年度优秀心理学图书之一。
干预措施: 电子书组参与者将阅读《情绪是什么》(How We Feel,Giovanni Frazzetto 著)中文版。该书是一部基于神经科学视角撰写的心理科普读物,系统阐释了主要情绪类型及其背后的脑机制,并结合研究证据与通俗易懂的现实案例,为参与者提供结构化的心理教育内容。该书曾被《卫报》评为年度优秀心理学图书之一。
对照组 2(豆包)
豆包(Doubao)是由字节跳动开发的一款被广泛使用的通用型大语言模型聊天机器人。近期报道指出,截至 2025 年末,其日活跃用户数已超过 1 亿,且在相对较低的获客营销投入下仍表现出较强的用户留存能力(36Kr, 2025)。因此,豆包可被视为一类具有现实代表性的通用型大语言模型聊天机器人,能够较好反映人们在现实生活中用于日常交流和情绪表达时可能接触和使用的工具。
干预措施: 豆包(Doubao)是由字节跳动开发的一款被广泛使用的通用型大语言模型聊天机器人。近期报道指出,截至 2025 年末,其日活跃用户数已超过 1 亿,且在相对较低的获客营销投入下仍表现出较强的用户留存能力(36Kr, 2025)。因此,豆包可被视为一类具有现实代表性的通用型大语言模型聊天机器人,能够较好反映人们在现实生活中用于日常交流和情绪表达时可能接触和使用的工具。
结局指标
主要结局
抑郁自评量表
时间窗: 完成招募后的一周内
次要结局
- 广泛性焦虑障碍量表(完成招募后的一周内)
- 积极消极情感量表(完成招募后的一周内)
- 用户体验可用性指标-简版(完成干预后的一周内)
- Barrett-Lennard 关系问卷普通话中文版(完成干预后的一周内)
