只看一批新闻的“平均情感是正面还是负面”,很容易漏掉真正有解释力的部分:同样偏负面的技术,有的已形成跨媒体共识,有的仍处于激烈争议;有的刚出现时备受追捧,后续却因安全事件转向谨慎。本研究以2022年7月至2024年7月的2,012,900条英文AI相关新闻标题为基础,利用机器学习建立六类可解释话语指标,再以大语言模型和人工标注进行交叉验证。本文会把数据流程、指标含义、主要发现、局限性和治理价值讲清楚,也补充AI与智能系统方向的SCI期刊如何发表、SCI期刊分区查询、影响因子核验及投稿准备方法,方便读者从研究设计一路看到期刊选择。

一、为什么平均情感不足以解释AI新闻
情感分析通常把文本压缩成正面、负面或中性标签。这种做法适合快速统计,却无法回答几个关键问题:负面报道是偶发波动,还是长期稳定的风险框架?不同媒体是否形成一致判断?技术在首次进入公共视野时的语气,和两年后的总体语气是否相同?高曝光是否会改变评价方向?
因此,这项研究不把“偏见”直接归因于个体读者,也不声称新闻一定会造成某种认知结果。六类指标描述的是信息环境的可测属性:标题如何分配正负评价、风险与收益的比例如何、叙事是否随时间变化、媒体之间是否分歧。它们可以提示某种有利于损失厌恶、锚定效应或熟悉效应出现的话语条件,但不能替代受众实验,更不能当作个人心理状态的证据。
二、数据从哪里来:201万条标题如何变成可分析样本
原始数据来自Event Registry,覆盖2022年7月18日至2024年7月17日,共2,012,900条英文AI相关新闻标题。研究使用包含7,490个概念的AI Innovation Taxonomy组织主题,先把标题中的Wikipedia概念与分类体系对齐,再选择相关度最高的概念作为该标题的主要主题。
分类体系中有425个AI核心概念实际出现在语料中,其中386个主题达到至少一种指标的计算条件。主题覆盖广泛,既有machine learning、natural language processing等方法,也包括facial recognition、ChatGPT等应用或具体系统。由于它们都是新闻报道组织信息时使用的“覆盖单元”,研究在分析阶段统一将其视为主题。
概念链接沿用经过验证的AI Concept Linker流程:既往Top-1链接精度为0.975,与独立主题映射的一致率为93.3%。主分析采用单标签分配,同时保留平均每篇2.34个概念的多标签版本作稳健性检查。研究还移除了160,503条转载或联播重复标题,约占链接样本的19.3%。去重后得到671,913条主题已链接的标题,覆盖386个主题;六项指标去重前后的排序相关均不低于0.93,说明结果并非由大量转载推高。
| 环节 | 具体做法 | 需要留意的解释边界 |
|---|---|---|
| 语料收集 | 两年内2,012,900条英文AI新闻标题 | 标题体现编辑选择与显著性,不等于全文论证 |
| 主题链接 | 用AI分类体系完成Top-1概念映射 | 具体系统和宽泛技术可能处于不同抽象层级 |
| 重复控制 | 移除160,503条转载标题 | 去重避免把联播规模误当成独立关注 |
| 情感分类 | DistilBERT对全量标题作正负二分类 | 没有中性类别,绝对负面数量会被高估 |
| 稳健性验证 | GPT-4o样本复标、人工基准与阈值敏感性分析 | 重点验证主题排序,而不是要求逐条标签完全相同 |
三、机器学习管线怎样运行
主分类器为在SST-2上微调的DistilBERT,共约6,700万参数。选择它的理由不是模型最大,而是可在不依赖外部API的情况下,对201万条标题进行确定性、可复现的全量推断。正面标题的复合分数取分类置信度,负面标题则取置信度的相反数,因此单条标题分数位于−1到+1之间。置信度较低的模糊标题自然靠近零,在均值型指标中所占权重更小。
评价取向与损失显著性使用正负标题计数;叙事漂移、曝光调整情感、来源分歧和新颖期框架使用带置信度的连续分数。这样的分工很重要:比率指标需要保留“有多少条”的直观意义,时间和来源指标则需要让不确定样本少影响总体走势。
四、六类话语指标分别在看什么
| 指标 | 计算思路 | 高值或正值意味着什么 | 容易误读的地方 |
|---|---|---|---|
| 评价取向(Valence) | 比较主题的正负标题占比,并校正语料总体轻微的正负不平衡 | 正值偏乐观,负值偏悲观,接近零表示正负较平衡 | 接近零不代表没有评价,只是两种评价接近 |
| 损失显著性(LSI) | 负面标题数 ÷ 正面标题数 | 大于1说明风险或损失框架占优 | 低样本主题的比率波动更大,需设置最低计数 |
| 叙事漂移(NDI) | 比较每周平均情感与首个观测周基线的平均绝对偏差 | 越高表示报道框架随时间越不稳定 | 成熟技术的“首周”只是数据起点,不是它首次出现 |
| 曝光调整情感(EASI) | 平均情感 ÷ log(1+提及量) | 在相对曝光水平下仍保持较正面的语气 | 它是相对指标,不能当作原始情感均值 |
| 跨来源分歧(CSDI) | 单一来源在某主题上的平均语气,与所有来源均值的绝对差 | 越高说明媒体之间评价差异越大 | 分歧也可能来自专业化报道,不必然是编辑偏见 |
| 新颖期框架(NPF) | 主题出现后前7天平均情感 − 全观察期平均情感 | 正值表示初期更乐观,负值表示初期更谨慎 | 窗口长度会影响数值,应做3天、14天等敏感性检验 |
五、研究结果:风险主题与方法主题形成不同话语环境
总体上,deep learning、natural language processing等技术与方法主题更常处在收益显著、偏乐观的框架中;deepfake、facial recognition等安全与权利敏感主题则明显偏向损失框架。Deepfake的损失对收益标题比为3.17,facial recognition为1.75。Botnet同样高度损失显著,LSI达到3.30。
但LSI相近不代表话语环境相同。Deepfake的CSDI为0.55,媒体之间相对一致;botnet的CSDI为0.75,报道更具争议性。也就是说,一个是“形成较稳定的负面共识”,另一个是“在负面基调下仍存在明显分歧”。如果只保留平均情感,这层差别会完全消失。
跨来源分歧最高的往往不是提及量最大的成熟话题,而是synthetic media、AI-generated art、LLaMA、PaLM、object detection和gesture recognition等新兴或边界仍不清晰的主题。以object detection为例,其CSDI为0.89、LSI为0.76,属于提及量中等、整体不算负面但媒体评价高度分散的主题。相反,artificial intelligence、ChatGPT和OpenAI等高流量主题更趋一致。每个主题的来源中位数为107家,最大单一来源对某主题的标题贡献中位数仅6.5%,来源集中度中位数为0.020,分歧结果并非少数媒体垄断样本造成。
新颖期框架还揭示了“先热后冷”和“先疑后暖”。Robotaxi的NPF为0.78,早期情感约为+0.47,随着安全事件进入报道,长期均值转为−0.31;digital twin的早期情感约为−0.15,长期均值则升到+0.48。采用3天与14天窗口重算时,与7天基线排序的Spearman相关分别为0.83和0.84,说明方向具有中等偏强的稳定性。
在EASI中,Algolia(0.185)、expert system(0.162)、quantum machine learning(0.157)、demand forecasting(0.156)和service robot(0.147)表现为“曝光不高但评价相对积极”;Megvii(−0.146)、Perplexity(−0.130)、Google Translate(−0.122)、Face ID(−0.121)和botnet(−0.089)在调整曝光后仍偏负面。这里不能简单得出“曝光越高越正面”的结论,持续受到关注的应用仍可能长期处在批判性框架中。
六项指标并不是重复表达同一件事。LSI、EASI和Valence与平均情感高度相关,分别从比例、曝光校正和总体占比重新表达极性;NDI、CSDI和NPF与平均情感的相关绝对值不超过0.15,且均不显著。后三项真正增加了时间变化、来源差异和引入阶段的信息。
六、跨模型与人工验证:为什么排序比单条准确率更重要
二分类模型没有中性类别,会把描述性标题强行归入正面或负面。为检验这一限制,研究从高流量领域中分层抽取1,000条标题,并有意增加低置信度样本,再用GPT-4o按正面、负面、中性三类独立标注。GPT-4o将39.7%的样本判为中性;在非中性子集中,两种模型的总体一致率为73.8%,Cohen’s κ为0.47。DistilBERT的正面精确率较高(0.94),负面召回率较高(0.89),但负面精确率只有0.52,说明其绝对负面数量确有膨胀。
人工基准包含254条标题,由三位专家独立标注,Fleiss’ κ为0.80。GPT-4o对人工多数标签的准确率为72.0%,二分类DistilBERT为44.5%;人工标为中性的标题占33.9%,这正是二分类准确率受限的主要原因。研究因此没有用单条标签准确率掩盖问题,而是进一步检验研究真正依赖的“领域排序”。
在同时具有足够非中性样本的13个领域中,LSI排序相关为0.83,Valence与EASI均为0.82,均达到统计显著。高置信度分类占验证样本的68.2%,其一致性明显更高。阈值敏感性分析也显示:NDI排序对最低周数设置保持不变,Valence与LSI在不同最低计数下的相关不低于0.96。结论可以概括为:绝对数值需要谨慎解释,但跨领域的相对位置具有较好的稳健性。
七、与欧盟AI治理的关系:只能说“对应”,不能写成因果
研究把主题话语剖面与欧盟《人工智能法案》、数字服务法(DSA)及通用数据保护条例(GDPR)的治理对象作描述性映射。Deepfake与facial recognition的风险框架,和禁止性条款、高风险合规评估、深度伪造披露义务等严格治理位置形成对应;生成式AI和方法类主题更常出现乐观报道,与透明度、记录和信息披露导向的义务相呼应。
这不是“媒体导致监管”或“监管导致负面报道”的证据。技术本身的安全风险、隐私影响和部署规模,可能同时影响新闻语气与监管强度。政策使用者若把媒体指标当成风险情报,应同时查看事故、性能、申诉、市场规模和执法数据,不能把新闻中的损失显著性直接等同于客观危险程度。
Conversational AI内部也有明显分化:企业工具多为正面框架,面向消费者的聊天机器人则更常遭遇隐私质疑。Healthcare AI总体偏乐观,但早期报道更谨慎,随后逐渐转暖;已有的医疗器械法规可能为其公共讨论提供相对稳定的制度背景。CSDI较高的新兴生成与感知技术,则更接近DSA关注的系统性信息风险与信息完整性问题。
八、这项研究仍有哪些限制
只有标题:标题适合测量显著性与编辑框架,却无法恢复正文的论据、引语和限定条件。
只有英文:如果讨论欧盟信息环境,还需要德语、法语、意大利语、波兰语、荷兰语、希腊语等成员国语言,并结合媒体所在地筛选,而不是只按语言归类。
观察期有限:两年恰逢生成式AI快速扩散和欧盟立法推进,结果可能带有特殊时期特征。
中性类别缺失:二分类器系统性高估负面数量;当前证据支持排序稳定,不等于绝对值没有偏差。
人工样本仍小:254条三人标注是有价值的基准,但更大、跨语言的人工集会让结论更坚实。
指标不是心理诊断:它们描述新闻环境,若要判断受众风险收益认知是否发生变化,仍需实验或长期追踪。
不能强行合成总分:六项指标含义不同,未来若用于决策,需要明确权重、传播分类不确定性,并进行多准则分析。
九、这类人工智能研究的SCI期刊如何发表
先回答“SCI期刊是什么”:SCI通常指被Web of Science核心合集中的Science Citation Index Expanded收录的期刊。SCI期刊论文是否适合投稿,不能只看影响因子,还要看研究问题是否属于期刊范围、方法是否可复现、数据授权是否清楚,以及结论有没有超过证据边界。
把问题写窄。这类文章的核心不是泛泛讨论AI新闻,而是检验六项指标能否在大规模语料上提供超越平均情感的结构信息。
把数据链写完整。说明采集时间、语言、授权、去重方法、主题链接规则、缺失处理和最低样本阈值。
把验证放到主文。二分类强制分配中性样本是主要方法风险,跨模型、人工标注、阈值和窗口敏感性不能只放在补充材料。
把因果边界说清楚。新闻框架与治理层级之间是描述性对应,不应写成媒体影响了立法。
按范围筛选期刊。先读Aims & Scope和近两年相似论文,再做SCI期刊查询;最后核验SCI分区、审稿模式和费用。
从SCI期刊官网投稿。准备匿名正文、投稿信、数据与代码声明、伦理或授权说明、利益冲突声明及补充材料,不使用来路不明的入口。
逐条回复审稿意见。每条回复写明“意见—处理—修改位置—证据”,无法采纳时用数据与方法解释,不用情绪化语气。
常见SCI期刊查询词,分别该查什么
不少读者会同时搜索SCI期刊网站、SCI期刊官网、SCI期刊分区查询、SCI分区查询或SCI期刊影响因子查询。几个入口的用途不同:是否被SCIE收录以Web of Science Master Journal List为准;影响因子看Journal Citation Reports;分区需要先区分JCR Quartile和中科院分区;费用、开放获取选项与投稿格式应回到出版社官网核对。论坛上的“SCI期刊 Dcard”经验可以参考流程,却不适合作为收录和指标证据。
| 常见搜索词 | 真正需要核验的信息 | 与本文的匹配判断 |
|---|---|---|
| Advanced Intelligent Discovery影响因子 | 新刊是否已有JCR正式数据,不能把预测值当成影响因子 | 可关注,但需先核对主题范围和当前收录状态 |
| Complex & Intelligent Systems几区 | JCR学科分区、中科院分区、当年口径 | 复杂智能系统、可解释机器学习方向较接近 |
| International Journal of Intelligent Systems几区 | 当前收录、学科类别、最新JCR指标 | 需强化智能系统方法贡献,不宜只写媒体现象 |
| Advanced Intelligent Systems版面费 | 是否全OA、APC金额、税费与机构协议 | 方法创新充分时再考虑,费用以录用时官网为准 |
| International Journal of Machine Learning and Cybernetics LetPub | 第三方经验之外,还要核对出版社范围、投稿指南和JCR | 机器学习管线与验证设计有潜在匹配度 |
| Human-Centric Intelligent Systems LetPub | 数据库收录、开放获取政策和人本智能范围 | 若突出公共风险认知和人机社会影响,可进一步评估 |
| Journal of Intelligent Manufacturing怎么样 | 期刊范围、近年论文、处理周期与费用 | 当前媒体语料主题偏离制造;除非改为工业AI场景,否则不优先 |
做SCI期刊影响因子查询时还要记录查询年份。影响因子和SCI分区会更新,第三方页面可能滞后;投稿当天再次访问SCI期刊官网,确认收录、栏目、字数、开放获取费用和数据政策。把期刊名称逐个塞进摘要或结论不会提高论文质量,这些词更适合集中在投稿指南与查询说明中。
十、从初稿到见刊,最容易漏掉的材料
| 阶段 | 建议准备 | 本文类型的检查重点 |
|---|---|---|
| 投稿前 | 范围匹配表、方法流程图、数据字典、代码说明 | 语料授权、重复处理、概念链接误差 |
| 首次投稿 | 正文、Cover Letter、声明、补充材料 | 明确六指标相对平均情感新增了什么 |
| 外审修改 | 逐条回复表、带修订稿、清洁稿 | 补充中性类别、跨语言和阈值敏感性说明 |
| 录用校样 | 作者信息、图表、公式、数据链接最终核对 | 样本量、日期、κ与ρ数值必须前后一致 |
| 上线检索 | DOI、Online日期、数据库状态 | 官网上线不等于已进入WoS,需等待数据库更新 |
十一、常见问题FAQ
1. SCI期刊查询只看影响因子可以吗?
不可以。先看Aims & Scope和近两年文章,再核验是否被SCIE收录、JCR分区、费用、审稿模式和数据政策。影响因子只是其中一个指标。
2. SCI分区和SCI期刊分区是同一个概念吗?
日常表达经常混用,但实际查询要说明口径。JCR Quartile按Web of Science学科排名分为Q1至Q4;中科院分区是另一套体系,年份和大类、小类也可能不同。
3. 机器学习论文一定要用最大的模型吗?
不一定。本研究用较小的DistilBERT完成全量、确定性推断,再用大模型和人工样本验证排序。模型选择应服务于研究规模、成本、复现和误差控制。
4. 二分类模型没有中性类别,论文还能发表吗?
可以,但必须正面处理限制。应报告中性样本比例、分类偏差、人工基准和跨模型结果,并把结论限制在证据支持的层级。本研究支持领域排序稳健,不支持忽略绝对值偏差。
5. 为什么期刊官网上线后还查不到SCI检索?
出版社上线、分配DOI、进入Web of Science记录并不是同一时点。可先用DOI和准确题名查询,间隔一段时间复查,不要把官网页面误当成已完成数据库检索。
6. “SCI期刊 Dcard”或LetPub经验能不能作为选刊依据?
可以用来了解作者体验和常见流程,但收录、影响因子、分区、费用与投稿要求应以Master Journal List、JCR和出版社官网的当年信息为准。
结语
这项研究的价值不在于再做一次正负情感统计,而在于把AI新闻拆成可比较的话语剖面:风险是否占优、叙事是否漂移、媒体是否分歧、早期框架与长期框架是否一致。201万条标题提供了规模,结构化分类体系提供了领域分辨率,GPT-4o与人工标注则揭示了二分类模型的真实边界。对于准备同类SCI期刊论文的作者,最值得借鉴的并不是某个模型名称,而是“全量可复现处理+分层样本验证+明确结论边界”的研究设计。