Command Palette
Search for a command to run...
计算机科学成就与写作技能预测“氛围编程”熟练度
计算机科学成就与写作技能预测“氛围编程”熟练度
Sverrir Thorgeirsson Theo B. Weidmann Zhendong Su
摘要
许多软件开发平台现在支持由大语言模型驱动的编程,即“氛围编程”(vibe coding),这是一种允许用户用自然语言指定程序并从观察到的行为中进行迭代的技术,全程无需直接编辑源代码。尽管其应用正在加速普及,但关于哪些技能最能预测这种工作流程中的成功,目前知之甚少。我们报告了一项预先注册的横断面研究,研究对象为高等教育阶段学生(N = 100),他们完成了计算机科学成就、领域通用认知技能、书面沟通熟练度以及一项氛围编程评估的测量。任务经由八位专家的共识流程筛选,并在一个专门构建的、模拟商业工具但支持受控评估的氛围编程环境中执行。我们发现,写作技能和计算机科学成就都是氛围编程表现的重要预测因素,并且在控制领域通用认知技能后,计算机科学成就仍然是显著的预测因素。这些结果可能为工具和课程设计提供参考,包括在支持未来软件创作者时,应何时强调提示词撰写与计算机科学基础。
一句话总结
在一项预先注册的横断面研究中,研究者以高等教育阶段学生为样本(N=100),在 ETH Zu¨rich 发现,书面沟通能力和计算机科学成绩均能显著预测 vibe-coding 表现,且在控制领域一般认知技能后,计算机科学成绩仍是显著预测因子,这一发现为基于大语言模型的编程工具与课程设计提供了参考。
核心贡献
- 报告了一项预先注册的横断面研究,以 100 名高等教育阶段学生为样本,测量计算机科学成绩、领域一般认知技能、书面沟通能力和 vibe-coding 表现,任务由八位专家通过共识流程筛选,并使用一个专门构建的、可模拟商业工具同时支持受控评估的环境。
- 引入了一个受控的 vibe-coding 评估环境,该环境对参与者隐藏源代码,允许在无状态、单轮设置中通过大语言模型进行迭代式 GUI 导向编程,这与典型的大语言模型工作流有所不同,但提供了更严格的实验控制。
- 研究发现,书面沟通能力(r = .29)和计算机科学成绩(r = .39)均能显著预测 vibe-coding 表现,在控制领域一般认知技能后,计算机科学成绩仍是显著预测因子,且这两个构念对 GUI 导向的 vibe-coding 结果具有独立贡献。
引言
集成大语言模型的开发平台如今允许用户通过自然语言描述来构建软件,这种工作流被称为 vibe coding。这一转变引发了关于哪些技能对未来开发者最为重要的讨论,尤其是在学生和成年人的书面沟通能力似乎持续下降的背景下。已有研究考察了提示质量或编程经验对基于大语言模型的编程辅助的影响,但很少有研究在受控环境中同时直接测量写作能力与计算机科学成绩,且尚无研究单独考察纯无代码的 vibe coding 变体,即用户完全看不到生成的源代码。
作者通过一项预先注册的横断面研究(100 名大学生)来填补这一空白。他们使用一个模拟商业 AI 编程工具的自定义平台,测量了计算机科学成绩、书面沟通能力、领域一般推理能力和 vibe-coding 表现。参与者在无法查看或编辑代码的情况下,通过迭代式地向大语言模型发出提示来解决 GUI 导向任务,任务集由八位专家通过结构化共识流程进行验证。
作者发现,计算机科学成绩和写作能力均能显著预测 vibe-coding 表现,其中计算机科学成绩在联合模型中所贡献的独特方差约为写作能力的两倍。他们还贡献了一套经过验证的 GUI 导向 vibe-coding 能力评估任务集,以及一个专为受控实验设计的研究平台,用于支持关于大语言模型原生软件创建的后续实证研究。
数据集
作者通过专家征询、标准化工具和本地开发的评估相结合的方式构建数据集。该数据用于评估参与者在基于大语言模型的 agent 辅助下完成编程任务的表现,同时测量其书面沟通能力、计算机科学知识和一般推理能力。
任务设计与数据集构成
- 核心数据集包含三项编程任务,参与者需借助基于大语言模型的 agent 完成。
- 其中两项任务通过德尔菲式专家征询流程获得。八位来自不同地域和职业的专家被招募,根据跨学科性、现实相关性、GUI 优先实现、非平凡复杂度、时间可行性、规格清晰度和文化公平性等标准提出并评分任务。
- 经过两轮评分后,三项任务达到共识阈值(所有量表的中位数评分 ≥ 4,且至少 80% 的量表 IQR ≤ 1)。其中两项任务在描述上相似,被合并为一项。
- 第三项任务有意去情境化且非真实性,设计为一个带有模糊标签的小型 GUI 玩具应用,以避免可能使大语言模型产生偏见的强先验。
- 每项任务都配有用于评估行为保真度的评分标准,该标准在研究前已定义。参与者被告知无需模仿基础应用的风格或设计。
调查工具与附加数据子集
- 书面沟通能力: 由两位书面沟通领域的教师设计了一项基于任务的评估和解析式评分标准。提示要求参与者用 300 至 450 词向一位受过大学教育但非专业的成年人描述一个技术概念。评分标准包含五个维度,每个维度 1 至 5 分,满分 100 分。作文由两位独立评分者盲评,若分数差异超过十分,则引入第三位盲评者。
- 计算机科学成绩: 使用经过验证的 SCS1 评估中的 12 道题子集,该评估与语言无关且基于伪代码。子集包含定义性知识、代码追踪和代码补全各四道题,依据项目反应理论的难度和区分度指标进行筛选。限时 25 分钟,效度证据来自一项预试验研究。
- 一般推理能力: 使用 ICAR16(国际认知能力资源库的 16 题子集)测量领域一般认知技能,包含言语推理、矩阵推理、字母序列和三维旋转各四道题。经过预试验后确定限时 12 分钟,题目顺序随机化。
数据使用与处理
- 该数据集用于测量 vibe coding 这一构念,即从人类任务规格说明进行迭代式代码生成。
- 参与者需要自行表述目标行为,而非复制文本规格说明,以评估其向大语言模型 agent 阐明系统设计的能力。
- 书面沟通评分标准用于衡量领域一般能力,各标准被视为反映性指标。作者检验了结构化并传达技术信息的潜在能力是否能预测在大语言模型中介的编程任务中的表现。
- SCS1 子集和 ICAR16 作为协变量或控制变量,用于解释先前的计算机科学知识和一般认知能力。
- SCS1 子集和 ICAR16 的时限通过预试验确定,以避免与构念无关的速度因素,同时尽量减少测试疲劳。
方法
作者采用德尔菲式专家征询流程设计研究任务,以确保真实性和适当的复杂度。专家组生成了满足特定标准的任务,包括跨学科性、现实相关性、GUI 优先实现和时间可行性。最终任务集包含两项情境丰富型任务(复现和功能扩展)和一项去情境化任务,用于评估不依赖强先验标签的表达性规格说明能力。
为确保可复现的访问和严格的数据隐私,作者开发了一个专用的 vibe-coding 平台。该界面有意隐藏源代码,以符合纯 vibe coding 范式。
如上图所示,平台左侧为用于与 AI agent 交互的聊天窗口,右侧为实时应用预览。左侧边栏还显示任务描述和计时器。系统集成了便捷功能,如迭代回滚,以及一个刻意模糊化的模型输出实时流,用于传达进度而不允许复制代码。在底层 AI 方面,作者基于性能评估选择了 Anthropic Claude Sonnet 4。为优化吞吐量,平台采用基于差异的更新机制,模型仅返回必要的代码片段,而非重写整个文件。
为确保参与者在尝试复现或扩展之前充分探索示例应用,作者实现了一个功能跟踪机制。示例应用被植入监控功能,以跟踪功能使用情况并向用户提供明确反馈。
如上图所示,横幅会通知参与者是否遗漏了示例应用中的相关功能交互,从而通过聚焦编程能力而非应用理解来保持构念效度。
实验流程采用平衡设计以减轻顺序效应。
如上图所示,参与者被随机分配到两组。两组均完成人口统计调查,随后依次完成测试组(包括 ICAR16、作文任务和 SCS1)和 vibe-coding 任务(复现、功能添加和去情境化任务),两组顺序交替。这一结构化流程确保了对书面沟通能力与 vibe-coding 表现之间关系的严格评估。
实验
实验包括一项用于校准时限和优化 vibe-coding 平台的预试验,以及一项以 100 名学生为样本、测量写作能力、计算机科学成绩、认知能力和 vibe-coding 表现的主要研究。预试验验证了 SCS1 的时限,将 ICAR16 从 16 分钟缩短至 12 分钟,并将作文任务扩展至 300 至 450 词,同时增加了平台通知以保持构念效度。在主要研究中,写作能力与 vibe-coding 表现呈正相关,但在控制领域一般认知技能后,该相关性不再显著;而计算机科学成绩仍是显著预测因子,且贡献的独特方差约为写作能力的两倍。探索性分析发现,提示质量(由人工评分并通过词汇多样性衡量)中介了写作能力与 vibe-coding 结果之间的关系,更高质量的提示将更强的写作能力与更好的任务表现联系起来。
专家小组成员根据五项标准对拟议的 vibe-coding 任务进行评分,入选任务在整体评分上表现良好。考试排程器、膳食规划器和课程注册平台最终入选,这些任务在各标准上的得分普遍更高或更一致。部分任务(如眼动追踪应用)在清晰度上明显较低且分歧较大。入选任务(考试排程器、膳食规划器、课程注册)在平均评分上往往更高,尤其是在挑战性和目的清晰度方面。眼动追踪应用的目的清晰度评分最低,且在多项标准上的四分位距最宽,表明共识度较低。等距房间构建器和名人排名器在真实性和挑战性上的得分低于入选任务。所有任务的文化公平性评分普遍较高,大多数中位数接近或高于 4.4。
各研究工具的得分差异较大,写作能力的平均分最高,vibe-coding 任务的平均分最低,其中复现任务和去情境化任务的得分范围最广。信度检验显示,作文评分和自报量表的内部一致性可接受,但认知测试的一致性较低,因此仅作为协变量使用。主要构念之间的相关性大多为正且显著,写作能力和计算机科学成绩均与 vibe-coding 表现相关,但在控制认知测试后,仅计算机科学成绩的相关性仍然成立。写作能力的平均分最高,vibe-coding 任务的平均分在所有工具中最低。复现任务和去情境化任务的得分范围最宽,几乎覆盖了归一化量表的全部范围。作文评分的信度在重新校准后可接受,自报量表达到信度阈值,但认知测试未达标,仅作为协变量使用。除计算机科学成绩与写作能力之间的相关性较小且不显著外,所有主要构念之间的相关性均为正且显著。在调整认知测试后,计算机科学成绩与 vibe-coding 之间的联系仍然存在,但写作能力与 vibe-coding 之间的联系不再显著。
Vibe-coding 表现与计算机科学成绩、认知能力和写作能力均呈正相关,其中与计算机科学成绩和认知能力的关联最强。在控制认知能力后,写作与 vibe-coding 之间的相关性仍为正但有所减弱,表明认知因素存在部分中介作用。这一模式与提示质量作为写作能力与 vibe-coding 成功之间连接机制的解释一致。Vibe-coding 表现与计算机科学成绩和认知能力呈中等正相关,且均具有统计显著性。写作能力与 vibe-coding 表现呈正相关,但在控制认知能力后关联减弱。写作与 vibe-coding 之间的关系似乎由提示质量中介,因为当纳入提示质量后,直接效应不再显著。
写作能力与整体 vibe-coding 表现呈小而显著的正相关,但在控制一般认知能力后,这一关系减弱。在三项编码任务中,去情境化任务和功能添加任务与写作能力的相关性相近,而复现任务与写作能力无显著相关。提示质量似乎中介了写作能力与任务表现之间的大部分关联。写作能力与 vibe-coding 表现之间的总体相关性显著但较小,在控制一般认知技能后不再显著。去情境化任务和功能添加任务均与写作能力显著相关,而复现任务则不然。提示质量约占写作与 vibe-coding 表现之间总关联的一半,表明其作为中间环节发挥作用。
提示中的词汇多样性(以 HD-D 和 MTLD 衡量)与作文词汇多样性、作文成绩和 vibe-coding 表现均呈显著正相关。人工评分的提示质量也与作文成绩和 vibe-coding 表现呈正相关,中介分析表明提示质量可能将写作能力与 vibe-coding 结果联系起来。更高的提示词汇多样性与更高的作文词汇多样性、作文成绩和 vibe-coding 表现相关。人工评分的提示质量与作文成绩和 vibe-coding 表现均呈正相关。提示质量似乎中介了写作能力与 vibe-coding 表现之间的关系,约占总关联的一半。
专家小组成员基于挑战性和目的清晰度等标准上更高且更一致的评分,选出了三项 vibe-coding 任务(考试排程器、膳食规划器、课程注册),而眼动追踪应用等任务则清晰度较低且分歧较大。各工具得分差异较大,写作能力平均分最高,vibe-coding 最低;作文评分和自报量表的信度可接受,但认知测试未达标,仅作为协变量使用。Vibe-coding 表现与计算机科学成绩、认知能力和写作能力均呈正相关,但写作能力的关联在控制认知能力后减弱,且在很大程度上由提示质量中介。提示词汇多样性和人工评分的提示质量也与作文成绩和 vibe-coding 表现相关,支持提示质量作为写作能力与任务成功之间的中间机制。