生成式AI已经可以帮教师写代码、改界面、调Bug,甚至在几个小时内做出一个可以真正给学生使用的教学App。但“软件开发得快”和“学生学得更好”其实是两回事。一项真实医学教育研究就给出了一个很值得讨论的结果:教师使用Gemini 3.1 Pro通过Vibe Coding约1.5小时完成ECG学习工具核心功能,学生对App的整体uMARS评分达到4.57/5,自定义Quiz甚至达到4.92/5,可四次考试综合分析却没有发现稳定的ECG成绩提升。本文不只介绍Vibe Coding、生成式AI、人工智能教育和医学教育,而是重点分析为什么一个学生非常喜欢、功能也很完整的AI教学工具,最后可能仍然没有明显改变考试成绩,以及这种“开发成功但效果未证实”的结果,对教育AI研究和SCI论文设计意味着什么。

过去,一个医学教师如果突然产生一个想法:
“我想做一个ECG学习工具,让学生可以切换不同心律失常,还能直接和正常心电图比较。”
这件事真正落地,通常需要和开发人员沟通。
需求整理一次。
原型做一次。
不满意再改。
一个很小的功能也可能经过几轮沟通。
生成式AI正在改变这个流程。
现在教师可以直接告诉AI:
“我要什么。”
AI生成代码。
教师运行以后发现问题。
再告诉AI:
“这里不对,改一下。”
这个不断沟通、测试和修改的过程,就是目前经常被提到的:
Vibe Coding。
研究里的BlandPharm ECG Viewer由一名教师使用:
Gemini 3.1 Pro
完成开发。
最初并没有使用复杂的Prompt Engineering。
第一个需求其实很普通:
做一个交互式ECG Viewer,让用户选择不同心律失常,然后显示对应ECG。
之后整个过程基本就是:
生成代码。
运行。
看哪里有问题。
继续让AI改。
再增加新的教学需求。
最终:
核心功能大约1.5小时完成。
后续又花了约2天继续完善功能和界面。
| 阶段 | 实际过程 |
|---|---|
| 初始需求 | 自然语言描述ECG教学工具 |
| 核心原型 | 约1.5小时 |
| 后续迭代 | 约2天 |
| 开发方式 | Prompt—运行—测试—修改—Debug |
不能这么理解。
这里的1.5小时指:
核心功能原型。
不是:
一个经过完整软件工程、安全审核和大规模用户测试的成熟产品。
这一区别非常重要。
生成式AI大幅降低的是:
从想法到Prototype之间的门槛。
它并没有让:
软件质量控制;
用户测试;
数据安全;
教育效果评价;
长期维护;
自动消失。
真正值得研究的是:
教师没有单纯让AI生成一个漂亮界面。
后面的很多功能来自具体教学问题。
例如:
初学者为什么看不懂ECG?
其中一个原因是:
他们脑中还没有稳定的Normal ECG Reference。
所以App做了一个很简单但有教学意义的设计:
异常ECG下面或附近:
始终提供正常波形用于比较。
刚开始学ECG的人看到完整12-lead ECG,很容易出现一种状态:
哪里都在看,最后什么都没看懂。
专家知道某种异常最值得关注哪些Leads。
初学者不知道。
所以这个App会:
突出显示当前Rhythm最关键的Leads。
这实际上不是一个纯软件功能。
而是把教师平时课堂上的:
“这里重点看V1。”
“这个节律先注意这些Lead。”
写进了软件。
App会直接在心电图波形上:
标出关键异常。
这样的优势很直观。
学生不只是看到一句:
“P wave absent。”
而是能够知道:
在当前Waveform上到底应该看哪里。
对于初学阶段:
这能够降低很多不必要的搜索和认知负荷。
这是学生评分最高的功能。
传统题库经常存在一个问题:
学生刚学3种Rhythm。
系统直接给他20种。
大量没学过的题目会让练习效率变低。
这个ECG Viewer允许学生自己选择:
Quiz包含哪些Rhythms。
因此可以和课程进度保持一致。
作者加入排行榜:
希望通过Gamification让学生多做题。
这是现在很多教育App常见的做法。
但后面的结果也很有意思:
学生并不是最喜欢这个功能。
这说明游戏化不是放进去就一定有效。
答案非常明确:
喜欢。
26名学生完成了uMARS评价。
| 评价指标 | 平均分 |
|---|---|
| Engagement | 4.36 |
| Functionality | 4.64 |
| Aesthetics | 4.74 |
| Information | 4.53 |
| Overall App Quality | 4.57 |
满分:
5分。
所以单纯看User Experience:
结果相当不错。
第一名:
Quiz自定义。
平均:
4.92±0.27。
第二:
Waveform Annotation。
平均:
4.77±0.43。
正常和异常心律对照:
4.46±0.71。
Leaderboard:
4.19±1.06。
| 功能 | 评分 | 观察 |
|---|---|---|
| 自定义Quiz | 4.92 | 最受欢迎 |
| Waveform Annotation | 4.77 | 明显帮助初学者定位 |
| Normal Comparison | 4.46 | 视觉对照接受度高 |
| Leaderboard | 4.19 | 个体偏好差异更大 |
Recommendation评分:
4.81±0.49。
Overall Star Rating:
4.65±0.49。
如果这是一个产品测试:
这些数字已经非常漂亮。
但是:
教育工具不是普通消费App。
它最终还要回答另外一个问题:
学生真的学得更好吗?
没有发现稳定提高。
这反而是整篇研究最值得认真看的地方。
研究没有简单拿今年学生使用App后的成绩:
去和某一个平均分比较。
而是采用一个比较复杂的:
Triple-difference Framework。
因为这个研究不是Randomized Controlled Trial。
ECG Viewer只在一个教学Site上线。
另外五个Site作为Controls。
但是不同地点:
学生群体不同;
老师不同;
教学环境不同;
学习习惯也可能不同。
如果今年Experimental Site成绩高一点:
不能直接说:
“一定是App导致的。”
第一:
Year。
当前Cohort和上一届。
第二:
Site。
Experimental Site和其他5个Control Sites。
第三:
Question Type。
需要看ECG的Focal Questions。
和:
普通Baseline Questions。
三重比较:
构成DDD分析。
假设这一届学生整体都更聪明。
ECG题提高5%。
其他题也提高5%。
那就不能说:
ECG App产生了额外效果。
所以作者计算:
ECG Focal Performance - Baseline Performance。
希望把整个Cohort水平变化尽可能控制掉。
四场考试并不一致。
| 考试 | 相对ECG表现变化 |
|---|---|
| Exam 2 | -5.73 pp |
| Exam 3 | -3.02 pp |
| Exam 4 | +10.66 pp |
| Final Exam | -1.45 pp |
一会儿提高。
一会儿下降。
看不出稳定Direction。
Exam 2:
-3.56个百分点。
Exam 3:
-11.40。
Exam 4:
+12.82。
Final:
+0.29。
同样有正有负。
Pooled Estimate:
0.88个百分点。
95% CI:
-2.33至4.10。
p:
0.59。
简单来说:现有数据不能支持“使用这个ECG Viewer稳定提高了学生短期考试成绩”这一结论。
如果把目标定义成:
显著提高考试成绩。
当前研究确实没有证明成功。
但如果目标是:
验证教师能不能依靠AI自己迅速做出课程定制软件。
答案又是成功的。
所以这项研究实际上得到三个不同结论。
| 问题 | 结果 |
|---|---|
| 能不能快速开发? | 可以 |
| 学生喜欢吗? | 总体非常喜欢 |
| 短期成绩明显提高吗? | 目前没有证实 |
因为教育技术研究非常容易出现一个逻辑跳跃:
学生觉得好用。
所以:
这个工具有效。
但:
Usability和Learning Effectiveness不是同一个Outcome。
用户喜欢:
代表工具可能:
设计得好;
操作方便;
使用体验不错;
但学习成效还要看:
知识有没有掌握;
技能有没有迁移;
延迟测试能不能保持;
真实病例能不能处理。
研究提供了几个非常值得分析的可能原因。
第一个:
用得可能不够久。
ECG Interpretation属于复杂技能。
不是看几次标准波形:
马上就能完全掌握。
如果学生真正使用App的时间有限:
短期考试很难出现稳定Difference。
这是一个很大的Limitation。
研究并不知道:
每个学生:
到底登录了多少次;
用了多少分钟;
做了多少题;
哪种Rhythm练习最多;
哪些Feature真正使用过。
所以:
无法回答“用得越多,是不是进步越大”。
学生Overall App Quality:
4.57。
但Self-reported Usage:
3.62。
这个差距值得注意。
它说明:
学生完全可能觉得:
“这个工具很好。”
但实际并没有每天使用很长时间。
学生在开放反馈中提到:
目前的ECG波形:
比较标准、比较干净。
对于入门非常友好。
但真正考试:
以及真实临床:
不一定都给你一张非常典型的AF、AV Block或者其他Rhythm。
同一种病理:
也可能存在较大的Morphological Variability。
他们希望加入:
不同难度;
非典型波形;
更多同类Rhythm Variations;
NSTEMI;
Ischemia;
Clinical Distractors。
这其实直接暴露了:
教学软件和考试任务之间的Transfer Gap。
这个结论很反直觉。
App里面有:
重点Lead高亮;
正常ECG对照;
Waveform Annotation;
Guided Interpretation。
学习时:
这些Feature非常舒服。
考试时:
一个都没有。
学生必须自己知道:
先看哪个Lead。
异常到底在哪里。
该怎么排除其他Diagnosis。
Scaffolding不是越多越好。
好的教学设计往往应该:
先扶着,再慢慢放手。
例如:
| 阶段 | 可能的提示 |
|---|---|
| Beginner | 重点Lead+Annotation+正常对照 |
| Intermediate | 保留正常对照,隐藏Annotation |
| Advanced | 关闭重点提示 |
| Exam Mode | 完全独立Interpretation |
这样才更有机会把:
Recognition。
变成:
Independent Reasoning。
很多Generative AI论文会停在:
“我们使用ChatGPT开发了一个平台。”
或者:
“90%的学生对AI工具满意。”
这些可以成为结果。
但如果文章最终要讨论:
Learning。
就必须进一步测:
Performance;
Retention;
Transfer;
Behaviour;
Usage Dose。
至少从当前证据看:
它最明确改变的是:
教育软件谁可以做。
以前:
教师发现一个教学问题。
可能只能:
找现成软件。
或者:
找技术团队。
现在:
老师可以直接开始做Prototype。
这让教师从:
Technology Consumer
逐渐变成:
Technology Creator。
一个全国性商业软件:
必须照顾大量用户。
所以很多功能只能做得比较General。
而教师自己开发的小工具:
可以只解决:
“我这40名学生这个星期最容易错的问题。”
过去:
为了40个学生单独开发软件,成本可能完全不合理。
AI Coding让这种:
Micro-scale Educational Software。
开始变得现实。
Vibe Coding同样有明显风险。
比如:
代码Bug;
软件测试不足;
隐私问题;
Security Vulnerability;
维护困难;
结果不可复现。
特别是医学领域。
如果只是一个:
ECG Learning Simulator。
风险相对有限。
如果以后涉及:
Patient Data;
真实Diagnosis;
临床Recommendation;
医疗决策;
那就已经完全不是普通教学网页的审核标准。
因为Study Design本身有限。
只有:
一个Intervention Site。
其他5个Site作为Control。
不是随机分配。
因此:
地点本身的Teacher Difference、Student Culture以及额外资源:
都可能影响结果。
DDD能够控制一部分Difference。
但是不能完全消除Confounding。
研究只有:
Aggregate Site-level Exam Data。
这导致很多非常有意思的问题无法回答。
比如:
基础较弱学生是否收益最大?
高频用户是否进步更多?
排行榜排名和考试成绩有没有关系?
某种Rhythm练得多是否对应相关题目提高?
都不能分析。
至少应该收集:
| Analytics | 能回答什么问题 |
|---|---|
| 登录次数 | 学生是否真正使用 |
| 学习时长 | Dose和Outcome是否有关 |
| 题目数量 | Practice Volume影响 |
| 错误类型 | 学生到底哪里不会 |
| Feature Usage | 哪个教学功能真正产生价值 |
首先:
Multi-site。
不能只让一个教学点使用。
第二:
更长的Exposure。
ECG不是短期记忆任务。
第三:
Usage Analytics。
第四:
更真实的ECG Variability。
第五:
Scaffold Fading。
第六:
Randomised或Stepped-wedge Design。
很多人看到研究以后最容易问:
“如果换GPT效果会不会更好?”
“Claude Code是不是开发更快?”
这些当然也能研究。
但这篇真正值得复制的是:
研究链条。
现实教学问题。
↓
利用AI快速开发。
↓
让真实学生使用。
↓
评价User Experience。
↓
再评价Learning Outcome。
↓
分析两者为什么可能不一致。
如果只发问卷:
“你喜欢ChatGPT吗?”
“你觉得AI有用吗?”
越来越难形成有说服力的Research Contribution。
更完整的设计可以把:
Behaviour;
Objective Performance;
Qualitative Feedback;
Usage Log;
Control Group;
结合起来。
这也是Mixed-methods Design真正可以发挥价值的地方。
除了开发App:
研究还使用GPT作为:
Computational Assistant。
辅助计算:
DDD;
Year-over-year Change;
Confidence Interval;
Permutation p-value;
Standardized Effect。
为了检查结果:
相同分析独立重复了3次。
输出一致。
Gemini还参与了:
Inductive Thematic Analysis。
但作者并没有完全接受AI生成的Theme。
而是加入:
Human-in-the-loop。
研究人员重新对照Raw Responses进行检查。
不是:
“论文能不能让AI写。”
更值得研究的是:
AI能不能开发Research Tool;
AI能不能辅助Statistics;
AI能不能辅助Qualitative Coding;
怎么验证AI结果;
怎么保证Reproducibility。
这些问题本身都可以形成新的Research Direction。
| 常见问题 | 为什么不够 | 更完整的做法 |
|---|---|---|
| 只问学生是否喜欢AI | 只能证明Acceptability | 增加Objective Outcome |
| 只有单组前后测 | 难排除其他变化 | 增加Control或Quasi-experimental Design |
| AI做出来就说有效 | 开发成功≠教育有效 | 分开Feasibility和Effectiveness |
| 不记录AI工具实际使用量 | 无法研究Dose-response | 加入Learning Analytics |
| 直接用AI分析后发表 | 存在错误和Hallucination风险 | Human Validation+Reproducibility Check |
从当前研究可以进一步扩展:
Vibe Coding in Education;
Generative AI in Medical Education;
AI-assisted Software Development;
Human-AI Collaboration;
Learning Analytics;
Adaptive AI Learning;
AI-assisted Instructional Design;
Teacher-developed Educational Apps;
Scaffold Fading;
AI Learning Behaviour;
Medical Education Technology;
End-user Programming。
生成式AI和教育技术现在很热门,但“用了AI”本身已经越来越难成为足够强的创新点。
真正决定文章能不能形成完整Research Story的,通常是:
AI到底解决了什么实际问题,以及这个效果是否被可靠验证。
例如同样研究Vibe Coding,如果只记录:
“Gemini两小时帮我做出了一个App。”
更像Case Report。
如果继续加入:
传统开发Workflow比较;
开发时间;
用户体验;
真实Learning Outcome;
Control Group;
Usage Analytics;
Qualitative Feedback;
长期Follow-up;
研究价值会明显不同。
对于已经有生成式AI、医学教育、教育技术、LLM应用、Human-AI Collaboration等研究方向,或者已经有Dataset、问卷、实验结果、软件原型和论文初稿的项目,我们提供SCI发表辅导,可以根据当前进度协助Research Gap梳理、Study Design、统计分析、问卷设计、Control设置、Mixed-methods Analysis、Results与Discussion结构以及目标期刊方向。
尤其需要注意的是,SCI论文中最好不要把“满意度高”“AI生成速度快”和“学习有效”写成同一个结论。当前ECG Viewer就是一个很典型的反例:学生给出很高的主观评价,但考试结果没有显示稳定总体提升。把这种不一致认真解释清楚,往往比只挑最好看的Result更加有研究价值。
对于需要持续跟进整个投稿周期的项目,也可以选择投稿无限期服务直到见刊,在约定服务范围内持续协助目标期刊筛选、投稿材料准备、审稿意见分析、返修以及必要情况下重新匹配期刊等工作。具体审稿周期和最终结果仍由论文质量、研究设计及目标期刊真实审稿过程决定。
Vibe Coding是一种以自然语言和生成式AI协作的软件开发方式。用户描述需求,AI生成代码,然后通过不断运行、反馈、调试和修改完成软件。
至少对于功能范围明确的小型教学工具具有可行性。该研究中教师使用Gemini 3.1 Pro约1.5小时完成ECG Viewer核心功能,之后继续进行了两天迭代。
现有结果没有显示稳定提高。四项考试合并后的DDD估计为0.88个百分点,95% CI为-2.33至4.10,p=0.59。
可能原因包括使用周期较短、实际使用剂量未知、练习和考试任务不完全一致、ECG波形过于标准化,以及学习过程中Scaffolding较强但考试时提示完全消失。
uMARS Overall App Quality为4.57/5,其中Aesthetics为4.74,Functionality为4.64,整体接受度较高。
自定义Quiz获得最高评分4.92/5,其次是Waveform Annotation的4.77/5。
它指在学习初期提供较多提示和辅助,随着学习能力提高逐渐撤除这些提示,让学生最终能够独立完成任务。
如果不知道每个学生使用了多久、完成多少任务,就难以判断教育结果与AI工具使用量之间是否存在真正的Dose-response关系。
可以作为计算辅助工具,但关键统计结果仍应通过可复现方法验证。当前案例对AI辅助计算进行了三次独立重复检查。
它显著降低了领域专家把具体需求变成软件Prototype的技术门槛,尤其适合规模较小、需求非常具体的课程工具。
快速AI生成代码可能带来测试不足、Bug、安全、维护和可复现性问题,因此高风险医学软件不能只依赖自然语言生成后直接部署。
可以继续研究Vibe Coding、Human-AI Collaboration、AI辅助教学设计、Learning Analytics、Adaptive Learning、多中心教育干预以及AI生成教育软件的质量评价等。
可以根据已有研究协助Research Gap、实验和对照设计、问卷、统计方案、Mixed-methods Analysis、结果解释、Discussion以及目标期刊筛选等环节。
主要是在约定范围内持续跟进期刊选择、投稿准备、审稿意见分析、返修以及必要时重新匹配目标期刊,而不是只完成第一次投稿。
从这项研究来看,Vibe Coding至少证明了一件事情:
生成式AI正在迅速压缩从教学想法到可用软件之间的距离。
一个教师不需要先成为Professional Developer,就可以通过自然语言把自己的课程经验、学生困难和教学需求逐渐变成一个真正能够运行的App。
但同一项研究也说明了另一件更重要的事情。
AI可以解决“怎么把软件做出来”,却不会自动解决“学生怎么才能真正学会”。
ECG Viewer的学生评价非常高,核心功能开发速度也很快,但短期考试表现并没有出现稳定提升。这并不是一个应该被删除的负面结果,恰恰相反,它把AI教育研究最容易混淆的几个概念分开了:
可行性。
易用性。
接受度。
学习成效。
它们之间有关联,却绝不是同一件事。
未来真正有价值的AI教育研究,可能不再只是证明“教师可以使用AI”“学生喜欢AI”,而是进一步回答:
谁真正受益、使用多久才有效、什么教学设计能够促进知识迁移、AI提示什么时候应该撤掉,以及这些快速生成的软件怎样保证质量和安全。
如果这些问题能够逐渐解决,Vibe Coding带来的变化可能不只是让软件开发变快,而是让真正理解课程的人——教师自己——能够更直接地参与教育技术的创造和迭代。