应用心理学

人工智能技术在青少年未来取向评分中的适用性

  • 盖笑松 1 ,
  • 刘本扬 , *, 2 ,
  • 邸楠 3
展开
  • 1. 东北师范大学心理学院,长春 130024
  • 2. 吉林医药学院健康管理学院,吉林 132013
  • 3. 长春市智科软件设计有限公司,长春 130117
刘本扬,E-mail:

收稿日期: 2025-04-11

  网络出版日期: 2026-06-18

基金资助

吉林省教育厅科学研究项目(JJKH20260495SK);国家科技创新2030(2021ZD0200500)。

版权

版权所有,未经授权,不得转载、摘编本刊文章,不得使用本刊的版式设计。

Applicability of Artificial Intelligence Technology in the Assessment of Adolescents’ Future Orientation

  • Xiaosong GAI 1 ,
  • Benyang LIU , *, 2 ,
  • Nan DI 3
Expand
  • 1. School of Psychology, Northeast Normal University, Changchun 130024
  • 2. School of Health Services Management, Jilin Medical University, Jilin 132013
  • 3. Changchun Zhike Software Design Co., Ltd. Changchun 130117

Received date: 2025-04-11

  Online published: 2026-06-18

Copyright

Copyright reserved © 2026.

摘要

作品分析法能够有效揭示出青少年未来取向的发展趋势,但由于评分过程存在高成本、评分者素质高要求和主观性的问题,作品分析法在未来取向测量中难以广泛使用。为了解决以上问题,本研究探索基于人工智能技术的作品分析法在青少年未来取向评分中的可行性。选取307名来自不同教育阶段学生的未来取向作品,以人工评分为基准,考察智能评分结果的信度、区分度、重测信度以及效标关联效度。结果发现,智能评分信效度各指标良好,与人工评分一致性较高,初步验证了基于人工智能技术的作品分析法在未来取向评分中的可行性。研究表明,智能评分与人工评分极其接近并具有稳定性,有助于促进作品分析法在未来取向测量中的广泛应用。

本文引用格式

盖笑松 , 刘本扬 , 邸楠 . 人工智能技术在青少年未来取向评分中的适用性[J]. 心理与行为研究, 2026 , 24(3) : 393 -400 . DOI: 10.12139/j.1672-0628.2026.03.014

Abstract

The work analysis method is effective for revealing developmental trends in adolescents’ future orientation, but its widespread application is hindered by high costs, stringent rater requirements, and subjectivity in the scoring process. To address these issues, this study explored the feasibility of an artificial intelligence (AI)-based work-analysis method in scoring adolescents’ future orientation. Collecting datasets of future orientation works from 307 students at various educational stages and using manual scoring as benchmark, we evaluated the reliability, discriminability, test-retest reliability, and criterion-related validity of AI scoring. The results showed that AI scoring demonstrated good psychometric properties on all indices and achieved high consistency with the manual ratings. The feasibility of AI-based work-analysis method in future oriented scoring is thus validated preliminarily. Furthermore, in view of its high consistency and stability, AI scoring can facilitate the broader application of the work-analysis method in future orientation measurement.

1 引言

未来取向是指个人的思想和行为偏好未来的方向,并对未来进行思考与规划(刘霞 等, 2010)。未来取向是促进青少年积极发展的重要因素和心理保护因素。高未来取向水平的青少年不仅表现出更高的学校投入,取得较高的学业成就,具有较强的生涯决策效能感(Barnett et al., 2020; Burns et al., 2021; Chen et al., 2023; Walker & Tracey, 2012),而且能够预见当下行为的潜在风险及对未来生活产生的负面影响,从而避免物质滥用、风险驾驶、暴力行为和网络成瘾等问题的发生(Chen & Vazsonyi, 2013; Przepiorka et al., 2019; Stoddard et al., 2011; Wills et al., 2001)。鉴于未来取向对青少年积极发展的重要性,有必要探讨如何有效测量青少年未来取向水平。
为了探讨自陈问卷法、行为测试法和作品分析法在测量青少年未来取向发展趋势中的优势与局限,刘本扬等(2022)同时采用三种方法测量307名青少年的未来取向发展趋势。研究结果表明,在未来取向发展趋势的测量中,自陈问卷法存在不适用于跨年龄群体的纵向比较以及缺乏等值性的局限,而行为测试法仅能反映延迟折扣单一维度。相比之下,本研究证实了作品分析法的有效性。作品分析法精细的编码规则和评分机制确保了评分的可靠性和准确性,从而能够有效地揭示出不同年龄段青少年的未来取向发展水平。尽管作品分析法在测量青少年未来取向发展趋势方面具有明显优势,但其推广和应用受到以下三个方面的限制。第一,作品分析法评分过程需要较高的时间和人力成本。评分者需要对未来取向所有维度进行细致的逐一评估,每个维度进一步细分为三个等级。这一过程需要大量的时间和人力资源。第二,评分者需要具备较高的专业素养。本研究采用的双评分者模式要求两位评分者在评估青少年未来取向作品前,接受严格的编码规则培训,以确保他们对各维度内容和评分标准的精确把握。第三,评分过程中的主观性问题。在评分过程中,评分者可能无法完全避免主观判断的影响。因此,为了解决以上三方面问题,本研究旨在创新性地运用人工智能技术,探索基于人工智能技术的作品分析法在青少年未来取向评分中的适用性,提升青少年未来取向评分的效率。
随着人工智能(artificial intelligence, AI)技术的发展,大语言模型(large language models)出现并迅速发展,其拥有广泛的知识库,具有良好的自然语言理解能力和强大的信息生成能力,在心理学研究领域表现出了卓越的性能(Dwivedi et al., 2023; Strachan et al., 2024; van Dis et al., 2023),其中以下三种特定能力极其适用于未来取向的评分。第一,大语言模型具备强大的评判能力。该模型不仅能够生成具有高度关联性的知识语境,而且还能够根据用户的需求与反馈高精度生成和改进输出内容,同时具备对其所生成知识内容的评判能力(董艳 等, 2023; 冯志伟, 张灯柯, 2024; 刘明 等, 2023; 吴虑, 杨磊, 2023; 杨宗凯 等, 2023)。Peters和Matz(2024)的研究发现,大语言模型在大五人格维度评分结果与自我报告得分显著相关,其准确度与专门用于人格推断的监督机器学习模型相当。因此,运用大语言模型的评判能力,可以对未来取向各维度进行有效评分。第二,大语言模型具备较准确的推理能力。Törnberg(2023)的研究发现,大语言模型(例如GPT-4)在文本分析任务中,能够准确注释需要上下文知识推理的消息,并推断作者意图,展现出高准确率、可靠性和较低偏差。基于此,大语言模型的推理能力有助于分析青少年对未来设想的理解。第三,大语言模型具备优秀的跨语言处理能力。Rathje等(2023)的研究表明,大语言模型能够对多种语言(12种)的心理文本进行分析,具有较高的准确率和跨语言一致性。这一优势有助于推广作品分析法在多语言背景下的应用。
综上,鉴于大语言模型在心理学文本分析中的强大优势和应用潜能(Demszky et al., 2023; Iliev et al., 2015; Macanovic & Przepiorka, 2024; Peters & Matz, 2024),本研究创新性采用人工智能技术解决未来取向评分过程中耗时耗力的高成本问题,推动作品分析法在青少年未来取向测量中的应用。本研究以刘本扬等(2022)的未来取向内容为材料,使用大语言模型对先前研究中的原始未来取向内容进行评分,以原研究的人工评分为基准,从四个指标分别检验智能评分在未来取向作品分析评分中的有效性,即智能评分的信度、区分度、稳定性和效标关联效度。

2 研究方法

2.1 被试

在本研究中,采用刘本扬等(2022)研究中使用的未来取向作品作为评估数据集。该数据集涵盖了307名来自不同教育阶段的学生,包括小学五年级(n=84)、初中二年级(n=78)、高中二年级(n=71)以及大学二年级(n=74)。此数据集包含了从小学到大学的完整年级阶段,能够考察人工智能技术在评估青少年未来取向发展趋势以及对不同年级水平的区分度。此外,该数据集还包含了学生的“主观”评价指标—学校投入和“客观”评价指标—学业成绩(期末考试成绩)数据,这些数据被作为评估人工智能评分的效标。

2.2 研究程序

本研究使用大语言模型的代表性产品GPT-4对作品分析法测量的青少年未来取向的文本进行评分,该评分流程主要分为三个阶段。第一阶段是评分指导语的编制与校准。通过精心的修订和多轮的校对,本研究制定了针对未来取向维度(广度、密度、乐观性、计划性、执行性、内控性和超越性)的评分指导语,这一阶段涉及对指导语的多次修订和校正,以确保评分的准确性和一致性。为GPT-4设定的指导语示例为:“你是一个文本内容分析师。我将给你一份问卷调查数据。问卷是要求每个学生写一篇小作文。题目是《我的未来之路》。对于每篇文本内容,请根据维度说明以及维度计分规则进行评分,并给出每个维度评分的分析讲解,要求模型提供详细的评分理由,解释特定分数的依据,以及排除其余分数的理由。比如,乐观性:2分,是因为什么。比如评为1分,是什么原因没有评0分和2分。在进行评分时,重要的是保持一致性和公正性,确保每篇作文都按照同样的标准进行评估。”
以计划性维度为例。计划性维度的说明如下:“未来的目标和计划具体、明确,实现梦想的策略具有现实性和实用性,关于未来的计划具有灵活性,能够根据未来实际条件的变化而不断灵活调整,能够考虑到多种可能的未来;它不是那种不切实际的梦想,目标和计划显得成熟而不幼稚,具有可行性。”
计划性维度计分规则如下:“1.0到2.0分:对未来有明确的详细规划,通往目标的道路和计划成熟,有现实性和可行性、考虑到各种复杂条件下的灵活变通。0分到1.0分:虽然有方案、计划、路径、过程,但是较为简略笼统,缺乏可行性和现实性。0分:只空谈未来梦想,却没有可行方案、计划、路径,或者未提及此维度内容。如果提及但文章字数很少,则计为0分。注意:如果评分低是由于作文字数,被判断为不认真或比较幼稚导致分数低,请一定要描述出来。”
以编号为1368的作品为例:“我的未来之路,我好好学习,好好努力学习,考上一个好的高中,在高中这三年努力考上一个好大学之后,找一个好工作,安安稳稳地上班,挣钱,找一个好对象,踏踏实实过日子,孝敬我爸妈不让他们受累。”GPT-4在计划性维度上输出的得分为0.9分,评分依据是有明确的学业和职业规划(OpenAI, 2023)。
第二阶段是GPT-4的前测检验。本研究基于人工评分的结果,选取了20份样本(包括10份高分和10份低分的未来取向内容)对GPT-4进行初步测试和训练。通过比较GPT-4的评分结果与人工评分结果,本研究发现两者之间具有较高的评分一致性,即人工评分的低分或高分,GPT-4也都输出相应的低分或高分,这表明GPT-4在初步测试中表现良好,初步通过了前测检验。第三阶段是GPT-4的正式评分应用。GPT-4被应用于对307份青少年未来取向作品的正式评分。这一过程利用了GPT-4在前两个阶段所展现的评分能力,将其扩展到更大的数据集上。通过以上这三个阶段的实施,能够有效地利用GPT-4对青少年未来取向进行评分,同时保持了评分的高标准和一致性。
本研究的初始数据收集与处理阶段所采用的是当时最新版本的GPT-4,所有实验设计、指导语及算法构建均基于GPT-4进行。后续GPT-5模型正式发布。为更好地验证智能评分结果的稳定性和有效性,采用GPT-5对全部数据进行了重新分析。

2.3 数据统计与分析

本研究的数据分析工具包括SPSS23.0及人工智能模型GPT-4与GPT-5。数据分析步骤如下:运用GPT-5对刘本扬等(2022)研究中的未来取向作品进行智能评分,并以原研究的人工评分为参照标准,从四个方面对智能评分结果进行验证:(1)信度检验,通过计算智能评分与人工评分之间的一致性系数;(2)区分度检验,绘制未来取向评分的年级发展趋势图并进行方差分析,以检验其年级区分效度;(3)稳定性检验,基于GPT-4(首次测量)与GPT-5(重测)的评分结果,计算重测信度;(4)效标效度检验,通过计算智能评分与学生学业成绩、学校投入的相关系数进行验证。

3 结果

3.1 人工评分与智能评分结果的一致性

为了检验人工评分与智能评分在青少年未来取向水平评估结果的一致性,先将原始分数全部转化为Z分数,再将其转化为T分数,得出平均数和标准差。然后在每个年级阶段,分别计算Cohen’s d并进行组内一致性检验。结果发现,小学五年级、初中二年级、高中二年级和大学二年级的两组评分的Cohen’s d分别为:0.23、−0.18、−0.06、0.05;组内相关系数分别为:0.76、0.80、0.75、0.78,总体一致性系数为0.82,ps<0.01。如表1所示。
表1 人工评分与智能评分的未来取向T分数(M±SD)、Cohen’s d和组内相关系数
小五(n=84) 初二(n=78) 高二(n=71) 大二(n=74)
人工评分 43.95±5.55 50.76±8.98 50.49±9.54 55.60±11.71
智能评分 42.48±7.01 52.42±9.35 51.02±8.64 55.00±10.10
Cohen’s d 0.23 −0.18 −0.06 0.05
组内相关系数 0.76** 0.80** 0.75** 0.78**

  注:*p<0.05,**p<0.01,以下同。

以上指标显示,Cohen’s d值在0.05~0.23之间,且总体组内相关系数较高,说明智能评分与人工评分两种评分方式在各年级组均表现出较高的一致性,智能评分基本接近人工评分结果。
为了对比人工评分与智能评分在青少年未来取向各维度之间的差异,对每个维度都进行智能评分结果与人工评分的组内一致性检验。结果如表2所示。
表2 人工评分与智能评分的未来取向各维度组内相关系数
广度密度乐观性计划性执行性内控性超越性
组内相关系数0.28**0.42**0.41**0.59**0.28**0.74**0.28**
结果显示,人工评分和智能评分在广度、执行性和超越性维度评分一致性相对较低,在计划性和内控性两维度评分一致性相对较高。

3.2 人工评分与智能评分未来取向年级发展趋势

为了检验智能评分的年级区分度,分别绘制智能未来取向评分和人工评分的年级发展趋势图。为直观表现两种评价方法年级未来取向发展趋势,将两种原始评分结果分别转化为Z分数,然后再转换成T分数后作图,结果如图1所示。
图1 人工评分与智能评分年级发展趋势图(T分数)
图1展示了不同教育阶段青少年未来取向的人工评分与智能评分结果。对于小学五年级、初中二年级、高中二年级和大学二年级的未来取向水平,人工评分(T分数)分别为43.95、50.76、50.49、55.60,智能评分(T分数)分别为42.48、52.42、51.02、55.00,智能评分与人工评分的青少年未来取向发展水平线形图趋于一致,均随年级增加而呈上升趋势。
为了进一步检验人工评分与智能评分在各年级上的差异,对评分结果2(评价方式:人工评分、智能评分)×4(年级:小学、初中、高中、大学)进行方差分析,结果显示,评价方式主效应不显著[F(1, 303)=0.01, p>0.05],说明人工评分和智能评分之间不存在显著差异。年级的主效应显著[F(3, 303)=28.86, p<0.001, η${_{\rm p}^2} $=0.22],说明不同年级的学生在未来取向得分上存在显著差异。事后检验发现,大学生未来取向水平显著高于小学(p<0.01)、初中(p<0.05)和高中(p<0.01);小学生的得分显著低于初中、高中(ps<0.001);高中生与初中生得分之间的差异不显著(p>0.05)。评价方式与年级的交互作用显著[F(3, 303)=4.20, p<0.05, η${_{\rm p}^2} $=0.04],说明两种评分方式在不同年级之间是存在差异的。进行简单效应分析,结果发现:在大学阶段和高中阶段,人工评分与智能评分之间都无显著差异(ps>0.05);在初中阶段,人工评分显著低于智能评分(p<0.05);而在小学阶段,人工评分显著高于智能评分(p<0.05)。
以上方差分析结果表明,虽然智能评分与人工评分在低年级(小学、初中)评分存在细微差异,但评价方式的主效应不显著,说明智能评分与人工评分在整体上具有较高的一致性,即两种评价方式均一致地揭示了青少年未来取向随年级增长而提高的发展趋势。这表明智能评分在评估不同年级青少年未来取向水平时,具有较好的区分度。

3.3 智能评分的重测信度

为了考察智能评分的稳定性程度,采用GPT-5对GPT-4智能评分的同一批数据进行重评,然后对两次评分的结果进行相关分析,相关系数如表3所示。两次智能未来取向评分相关系数r=0.79,p<0.01,重测信度在可接受范围内。
表3 智能评分稳定性系数
总分2广度2密度2乐观性2计划性2执行性2内控性2超越性2
总分10.79**0.71**0.63**0.68**0.63**0.27**0.66**0.35**
广度10.77**0.73**0.63**0.68**0.62**0.25**0.64**0.32**
密度10.77**0.70**0.67**0.64**0.64**0.29**0.66**0.31**
乐观性10.69**0.61**0.47**0.73**0.48**0.22**0.54**0.31**
计划性10.79**0.74**0.65**0.66**0.67**0.26**0.66**0.30**
执行性10.81**0.74**0.68*0.67**0.69**0.34**0.72**0.26**
内控性10.72**0.64**0.60**0.61**0.57**0.27**0.66**0.28**
超越性10.35**0.26**0.23**0.27*0.21**0.080.24**0.49**

  注:其中1代表GPT-4智能评分结果,2代表GPT-5重测智能评分结果。

以上相关结果表明,智能评分具有较好的重测信度,具有一定的稳定性。然而,超越性维度、执行性维度与总分及其他维度的相关系数较低,说明智能软件在评价超越性与执行性方面可能不够敏感。

3.4 两种评分结果与学校投入、学业成绩的相关性

为了考察智能评分的效标关联效度,分别将人工评分结果和智能评分结果与学校投入、学业成绩做相关分析,结果如表4所示。
表4 人工评分、智能评分与学习投入、学业成绩相关系数
人工评分智能评分
学校投入
小五0.37**0.41**
初二0.31**0.28*
高二0.190.23
大二0.36**0.47**
学业成绩
小五0.37**0.37**
初二0.33**0.25*
高二0.200.04
大二0.070.12
相关分析结果揭示了智能评分和人工评分与两种效标相关的一致性。具体来看,在小学五年级和初中二年级,两种评分结果均与学校投入、学业成绩呈显著正相关,具有一致性;在高中二年级,两种评分与两项效标均无显著相关,也具有一致性;在大学二年级,两种评分均与学校投入显著正相关,而与学业成绩相关不显著,再次表现出较高的一致性。总体来看,两种评分方式在与效标变量的关联模式上具有较高的一致性,这说明智能评分具有较好的效标关联效度。
综上,通过对智能评分的信度、未来取向年级趋势(区分度)、稳定性和效标关联效度这四种指标的考察,结果发现,智能评分与人工评分的组内相关系数较高(r=0.82, p<0.01),表明其评分信度较好;智能评分在描述青少年未来取向的发展趋势与人工评分相一致,即随着年级增加,青少年未来取向水平逐渐提高,表明智能评分对不同年级青少年未来取向水平体现出一定的区分度;两次智能评分的相关系数较高(r=0.79, p<0.01),表明重测信度良好;智能评分与学校投入和学业成绩之间存在相关性,表明其具有一定的效标关联效度。总体来看,智能评分结果与人工评分结果极其接近,说明初步验证了智能评分在作品分析法测得青少年未来取向内容评分的可行性。

4 讨论

本研究以原有人工评分为依据,考察了基于人工智能技术的作品分析法在未来取向评分中的适用性。研究结果发现智能评分的信度、区分度、重测信度以及效标关联效度都达到了可接受的程度,智能评分结果与人工评分结果极其接近。本研究的创新点在于将人工智能技术应用于作品分析法的评分过程中,有效解决了作品分析法在评分过程中耗时耗力的高成本问题,促进了作品分析法在青少年未来取向测量中的推广和使用。本研究的结果不仅支持了人工智能技术在心理学研究中的应用潜力,也为未来取向测量及高效评分提供了新的视角和方法论上的参考。
大语言模型(例如GPT)虽然不具有人类的思考能力,但具有强大的信息生成、评判、推理以及跨语言处理等能力,在多个领域展现出极高的应用潜力。大语言模型不仅对推进心理测量和实践发展具有重要的作用(Demszky et al., 2023; Dwivedi et al., 2023; Thorp, 2023; van Dis et al., 2023),而且在评估人格特质、文本标注和分析任务也具有较高的准确性(Cao & Kosinski, 2024; Gilardi et al., 2023; Peters & Matz, 2024; Rathje et al., 2023; Strachan et al., 2024; Törnberg, 2023)。本研究借助人工智能工具GPT来解决作品分析法评分过程的高时间与人力成本问题,促进作品分析法在青少年未来取向测量中的推广和使用。本研究结果与以往研究发现一致,揭示了GPT在文本分析应用中的强大优势(陆俊花, 2022; 肖国亮 等, 2023; 肖国亮 等, 2024)。
GPT作为一种人工智能工具,尽管在心理学应用中表现出较大优势(Törnberg, 2023),但也具有一定的局限性和挑战性。GPT赋能学习者学习的程度取决于学习者自身思维与能力水平,合理利用人工智能工具是高效解决问题的关键(董艳 等, 2023; Abdurahman et al., 2024; Thorp, 2023)。GPT输出结果的准确性受到提示词的质量、文本数据的特性和概念难度等因素的影响,即使是提示中的微小的措辞改变或重复相同的输入都会导致输出的差异(Pangakis et al., 2023; Reiss, 2023)。此外,GPT在处理文本和数字过程中也可能发生一些错误,因此应用自动文本分析工具的准确性需要进一步检验(Markowitz, 2024)。
本研究在初始测试阶段发现青少年未来取向评分结果受到文本篇幅的影响。人工评分者通常会将字数作为评判写作态度的一个标准。对于篇幅较短的作品,人工评分者认为该学生对未来的思考缺乏深度且态度不够认真,因而主观上倾向于给出较低的评分。智能评分系统不评估学生的写作态度,仅基于文本内容进行客观评分,因而可能会对短篇幅作品也给出较高的评分。对于篇幅较长的学生作品,人工评分者可能会依据内在的或无意识的隐含标准从大量文字中提取关键信息,而智能评分系统仍然依据评分标准客观评分。这表明,尽管智能评分在客观性和一致性方面具有优势,但在理解复杂语境和隐含意义方面仍存在局限。因此,在评分测试阶段,本研究对智能评分系统的指导语进行了反复修订与优化,平衡文本长度与内容质量的关系,提供更为明确的指导语,以增强智能评分系统对青少年写作态度、表达含义和意图的理解能力,确保智能评分结果的公正性和准确性。总体而言,人工评分可能在一定程度上包含了评分者的经验、态度和文化背景等主观因素,而智能评分则更侧重于客观、可量化的指标,力求在统一的标准下进行评价。
在检验智能评分的重测信度方面,发现智能软件在评价超越性和执行性方面可能不够敏感。超越性维度在智能评分重测中表现出的不稳定性,主要有两方面原因。一方面,超越性是一种比较高阶的心理构念,具有利他性,涉及人们对人生意义、社会责任和全球关怀等。对这种抽象概念的理解与表达本身就具有一定的复杂性,不同于可直接观察的行为或一般性的态度表达。另一方面,人们对超越性的描述方式具有多样性,从直接的利他行为描述到间接的价值观念陈述。此外,人们可能还会使用隐喻、哲学性语言、新颖流行语、个性化的描述,这些不同的表达方式都会增加智能评分的难度。在执行性维度上,智能评分重测信度不够稳定的主要原因在于,执行性本质上是一种与目标相关准备性紧密联系的心理构念,其核心在于人们当下的具体行动与未来目标之间的关联度。不同版本的智能模型在解读“当下行为”与“未来目标”的关联程度时,可能存在不同的判断标准,从而导致评分结果出现波动。因此,这两个维度在智能评分重测中的不稳定性,既反映了构念本身的复杂性,也揭示了当前AI技术在理解人类深层价值观以及判断行动与目标关联度方面的局限性。这一发现提醒人们,在将AI应用于心理评估时,需要特别关注涉及高阶思维能力与复杂目标关联的维度,可能需要开发专门的评分算法或结合人工评分来提高评估的准确性。
本研究发现,本研究所采用的智能评分系统(GPT-5)与人工评分在效标关联上表现出较高的一致性。这可能是人工智能新模型优化的结果。在研究初期,本研究曾使用GPT-4模型进行探索,结果发现,在初二年级中,智能评分、人工评分与这两种效标的相关性不具有一致性。人工评分所反映的未来取向与学校投入及学业成绩均呈现显著的正相关关系,而智能评分与这两项学业指标不相关。通过对学生写作内容的深入分析,本研究发现智能评分早期模型(GPT-4)在评估学生写作内容的可实现性方面存在局限。该模型主要基于文本的表面特征,可能对那些内容丰富但充满不切实际幻想的规划给予了较高分数。由于这些学生往往仅停留在空想层面,缺乏实际行动,因此其学校投入和学业成绩均较低。这一现象在处于青春期的初二年级学生中尤为明显。本研究采用了最新版本GPT-5模型进行重新评估,结果发现GPT-5的评分模式在所有年级均与人工评分保持了较高的一致性。这说明新模型GPT-5在一定程度上克服了早期版本的不足,在识别并区分务实规划与空泛幻想方面有了一定的提升,表明智能评分系统(GPT-5)具备良好的效标关联效度。
本研究通过采用主观指标(学校投入)和客观指标(学业成绩)来检验智能评分的效标关联效度,本研究开创性地探索了基于人工智能技术的作品分析法在未来取向评分中的应用,然而,研究范围限于中等地区的小规模样本。因此,未来研究可以在以下方面加以改进和完善。首先,未来研究需要扩大样本量和增加样本的多样性。为了增强研究的普遍性和外部效度,未来的研究应纳入农村地区、发达城市、特殊群体以及不同文化背景的样本。其次,智能评分系统在理解复杂情感、隐喻以及深层含义方面(例如区分远大志向与不切实际的幻想)需要进一步的指导和训练。未来的研究需致力于改进人工智能算法,尝试引入认知语言学理论来优化语义解析模块,增强其对作品深层含义的理解能力。最后,为了进一步提高智能评分系统的性能,建议未来研究开发融合文本与绘画等多模态特征的综合评分系统,提升对非语言表达的理解,进而提高智能评分系统的准确性和可靠性。

5 结论

基于对未来取向智能评分结果的信度、区分度、重测信度以及效标关联效度的验证,本研究发现智能评分结果与人工评分结果极其相近,初步验证了基于人工智能技术的作品分析法在未来取向评分中的可行性。
董艳, 夏亮亮, 李心怡, 侯彦华. ChatGPT赋能学生学习的路径探析. 电化教育研究, 2023, 44 (12): 14- 20, 34.

DOI

冯志伟, 张灯柯. 语言模型与人工智能. 外语研究, 2024, 41 (1): 1- 19, 112.

DOI

刘本扬, 盖笑松, 王国霞. 青少年未来取向三种测试途径的比较. 心理科学, 2022, 45 (5): 1152- 1158.

刘明, 吴忠明, 廖剑, 任伊灵, 苏逸飞. 大语言模型的教育应用: 原理、现状与挑战——从轻量级BERT到对话式ChatGPT. 现代教育技术, 2023, 33 (8): 19- 28.

DOI

刘霞, 黄希庭, 普彬, 毕翠华. 未来取向研究概述. 心理科学进展, 2010, 18 (3): 385- 393.

DOI

陆俊花. 人工智能背景下机器评分与人工评分的效度比较——以英语学习者故事复述评分为例. 成都师范学院学报, 2022, 38 (3): 84- 92.

吴虑, 杨磊. ChatGPT赋能学习何以可能. 电化教育研究, 2023, 44 (12): 28- 34.

DOI

肖国亮, 马磊, 袁峰, 郭成锋, 邢金宝. 智能评分技术应用效果的评价研究. 中国考试, 2023, (10): 17- 27.

肖国亮, 马磊, 袁峰, 邢金宝. 人事考试与测评领域人工智能应用新探索. 中国人事科学, 2024, (10): 1- 10.

DOI

杨宗凯, 王俊, 吴砥, 陈旭. ChatGPT/生成式人工智能对教育的影响探析及应对策略. 华东师范大学学报(教育科学版), 2023, 41 (7): 26- 35.

Abdurahman, S., Atari, M., Karimi-Malekabadi, F., Xue, M. J., Trager, J., Park, P. S., … Dehghani, M. Perils and opportunities in using large language models in psychological research. PNAS Nexus, 2024, 3 (7): 245.

DOI

Barnett, M. D., Melugin, P. R., & Hernandez, J. Time perspective, intended academic engagement, and academic performance. Current Psychology, 2020, 39 (2): 761- 767.

DOI

Burns, E. C., Martin, A. J., & Collie, R. J. A future time perspective of secondary school students’ academic engagement and disengagement: A longitudinal investigation. Journal of School Psychology, 2021, 84, 109- 123.

DOI

Cao, X. B., & Kosinski, M. Large language models know how the personality of public figures is perceived by the general public. Scientific Reports, 2024, 14 (1): 6735.

DOI

Chen, H., Wu, Y. H., Jiang, L., Xu, B. F., Gao, X. P., & Cai, W. J. Future orientation and perceived employability of Chinese undergraduates: A moderated mediation model. Current Psychology, 2023, 42 (31): 27127- 27140.

DOI

Chen, P., & Vazsonyi, A. T. Future orientation, school contexts, and problem behaviors: A multilevel study. Journal of Youth and Adolescence, 2013, 42 (1): 67- 81.

DOI

Demszky, D., Yang, D. Y., Yeager, D. S., Bryan, C. J., Clapper, M., Chandhok, S., ... Pennebaker, J. W. Using large language models in psychology. Nature Reviews Psychology, 2023, 2 (11): 688- 701.

Dwivedi, Y. K., Kshetri, N., Hughes, L., Slade, E. L., Jeyaraj, A., Kar, A. K., ... Wright, R. “So what if ChatGPT wrote it?” Multidisciplinary perspectives on opportunities, challenges and implications of generative conversational AI for research, practice and policy. International Journal of Information Management, 2023, 71, 102642.

DOI

Gilardi, F., Alizadeh, M., & Kubli, M. ChatGPT outperforms crowd workers for text-annotation tasks. Proceedings of the National Academy of Sciences of the United States of America, 2023, 120 (30): e2305016120.

DOI

Iliev, R., Dehghani, M., & Sagi, E. Automated text analysis in psychology: Methods, applications, and future developments. Language and Cognition, 2015, 7 (2): 265- 290.

DOI

Macanovic, A., & Przepiorka, W. A systematic evaluation of text mining methods for short texts: Mapping individuals' internal states from online posts. Behavior Research Methods, 2024, 56 (4): 2782- 2803.

DOI

Markowitz, D. M. Can generative AI infer thinking style from language? Evaluating the utility of AI as a psychological text analysis tool. Behavior Research Methods, 2024, 56 (4): 3548- 3559.

DOI

OpenAI. (2023). ChatGPT (Mar 14 version) [Large language model]. Retrieved April 11, 2025, from https://chat.openai.com/chat

Pangakis, N., Wolken, S., & Fasching, N. (2023). Automated annotation with generative AI requires validation. Retrieved April 11, 2025, from https://doi.org/10.48550/arXiv.2306.00176

Peters, H., & Matz, S. C. Large language models can infer psychological dispositions of social media users. PNAS Nexus, 2024, 3 (6): 231.

DOI

Przepiorka, A., Blachnio, A., & Cudo, A. The role of depression, personality, and future time perspective in internet addiction in adolescents and emerging adults. Psychiatry Research, 2019, 272, 340- 348.

DOI

Rathje, S., Mirea, D. M., Sucholutsky, I., Marjieh, R., Robertson, C. E., & van Bavel, J. J. GPT is an effective tool for multilingual psychological text analysis. Proceedings of the National Academy of Sciences of the United States of America, 2023, 121 (34): e2308950121.

DOI

Reiss, M. V. (2023). Testing the reliability of ChatGPT for text annotation and classification: A cautionary remark. Retrieved April 11, 2025, from https://doi.org/10.48550/arXiv.2304.11085

Stoddard, S. A., Zimmerman, M. A., & Bauermeister, J. A. Thinking about the future as a way to succeed in the present: A longitudinal study of future orientation and violent behaviors among African American youth. American Journal of Community Psychology, 2011, 48 (3−4): 238- 246.

DOI

Strachan, J. W. A., Albergo, D., Borghini, G., Pansardi, O., Scaliti, E., Gupta, S., ... Becchio, C. Testing theory of mind in large language models and humans. Nature Human Behaviour, 2024, 8 (7): 1285- 1295.

DOI

Thorp, H. H. ChatGPT is fun, but not an author. Science, 2023, 379 (6630): 313.

DOI

Törnberg, P. (2023). ChatGPT-4 outperforms experts and crowd workers in annotating political twitter messages with zero-shot learning. Retrieved April 11, 2025, from https://doi.org/10.48550/arXiv.2304.06588

van Dis, E. A. M., Bollen, J., Zuidema, W., van Rooij, R., & Bockting, C. L. ChatGPT: Five priorities for research. Nature, 2023, 614 (7947): 224- 226.

DOI

Walker, T. L., & Tracey, T. J. G. The role of future time perspective in career decision-making. Journal of Vocational Behavior, 2012, 81 (2): 150- 158.

DOI

Wills, T. A., Sandy, J. M., & Yaeger, A. M. Time perspective and early-onset substance use: A model based on stress-coping theory. Psychology of Addictive Behaviors, 2001, 15 (2): 118- 125.

DOI

文章导航

/


版权所有 © 《心理与行为研究》编辑部
地址:天津市西青区宾水西道393号,天津师范大学106#邮箱 邮编:300387
电话:022-23540231, 23541213 E-mail:psybeh@126.com
本系统由北京玛格泰克科技发展有限公司设计开发