EEG与AI
EEG信号进入AI模型前,采样、滤波和分段怎样改变结果
采样率决定能够观察的时间细节
采样率限制可表示的最高频率,也影响事件时间点和波形边缘。把高采样数据降采样可以减少计算量,但必须先处理混叠风险。
不同数据集若采用不同采样率,简单插值到同一长度并不会让测量条件相同。模型可能利用插值痕迹识别数据来源,而不是识别研究目标。
参考方式改变每个通道的数值
EEG记录的是电位差,参考电极和重参考策略会改变通道波形。平均参考、耳垂参考和双极导联各有前提,不能只在方法里写一句“已标准化”。
跨数据集合并时,应保留原始参考方式和重参考步骤。若参考信息缺失,结论需要明确这一限制。
滤波器会同时移除噪声与部分信号
高通滤波可以减轻缓慢漂移,低通滤波可以抑制高频噪声,陷波用于处理电源频率干扰。但截止频率、滤波阶数和相位处理都会改变波形。
过强滤波可能让事件边缘变形,零相位处理又使用未来样本,不适合直接模拟实时系统。离线准确率与实时可用性因此不能自动等同。
伪迹处理是研究判断,不是清洁按钮
眨眼、肌电、运动和电极接触不良会影响EEG。独立成分分析、阈值剔除和人工检查能够减少部分伪迹,但每种方法都可能同时移除有意义成分。
团队应记录剔除比例和判断规则。只展示处理后的干净波形,会让外部研究者无法判断数据质量门槛是否改变了样本构成。
分段方式定义了模型看到的问题
按固定窗口切段、按刺激事件切段或按临床阶段切段,产生的样本单位不同。窗口重叠会增加样本数量,却也让相邻样本共享大量信号。
训练集和测试集若在切段后随机分配,同一受试者的相邻窗口可能同时出现于两边,造成数据泄漏。应优先按受试者或采集会话划分。
标签的时间尺度必须与信号匹配
受试者层级标签不一定能精确描述每个数秒窗口。把一个人的总体分类复制到所有片段,会引入标签噪声,也可能让模型学习个体特征。
文章报告性能时,应写清标签来自诊断、任务条件、专家判断还是自动规则,以及它与输入窗口之间的关系。
归一化可能泄露测试信息
使用全数据均值和方差进行归一化,会让测试集信息提前进入训练过程。正确做法通常是只用训练数据估计参数,再应用到验证和测试数据。
按通道、按片段或按受试者归一化会保留不同特征。选择方法要与研究问题一致,而不是只追求更高分数。
模型可能识别设备而不是生理模式
不同放大器、导联布局和实验环境会留下稳定差异。当病例与对照恰好来自不同设备时,模型很容易把设备当成捷径。
跨设备或跨机构验证能够暴露这种问题。若性能明显下降,应检查数据来源与目标标签是否纠缠,而不是立即增加模型复杂度。
评价指标要对应实际比例
类别不平衡时,单看准确率可能掩盖少数类别表现。灵敏度、特异度、精确率、召回率和校准分别回答不同问题。
片段级高分也不等于受试者级判断可靠。聚合规则、置信区间和重复测量应写入评价设计。
复现需要保留处理顺序
滤波后再切段与切段后分别滤波可能产生不同边缘效应;先剔除通道再重参考也会改变平均参考。只列出工具名称无法复现实验。
可复现记录应包含原始数据版本、软件版本、参数、处理顺序、随机种子和划分名单。文件传输后要验证这些伴随资料是否一起到达。
FlyBit场景中的实际行动
跨设备传递EEG资料时,应把原始数据、处理脚本、参数文件和结果分开保存,并用清单连接版本。移动端适合查看摘要,不应被当成完整分析环境。
连接工具可以帮助文件到达,却不能证明分析设计正确。最终判断仍要回到采集条件、处理过程与独立验证。
导联缺失会改变空间信息
不同设备的通道数量和放置位置不同,缺失通道不能只用零值填补。零值本身可能成为模型识别设备的线索。
跨数据集任务可以选择共同导联、建立明确插值规则或分别训练比较。每种选择都会缩小或改变可回答的问题。
电源频率反映采集环境
不同地区常见的工频干扰可能不同,陷波设置也随之变化。模型若在频谱中学到这些差异,可能把采集地点误认为类别。
频谱质量检查应在滤波前后同时进行。只查看处理后结果,看不见原环境对数据造成的压力。
事件标记也可能存在时间误差
刺激程序、采集电脑和放大器之间的延迟会影响事件相关分析。标记写入文件不代表它与真实刺激呈现完全同步。
需要毫秒级结论时,应通过光电二极管或其他独立信号估计延迟,并把修正方法写入流程。
睡眠、静息与任务EEG不能共用同一解释
数据都属于EEG,但行为状态、记录长度、伪迹构成和标签尺度不同。一个领域的窗口长度与频带选择不一定适用于另一个领域。
迁移模型前要比较任务条件,而不是只比较通道和采样率。输入形状一致只是技术条件。
受试者内验证与受试者间验证回答不同问题
同一个人的部分数据用于训练、另一部分用于测试,衡量的是个体内泛化。完全未见过的受试者测试更接近跨人使用。
两种设计都可以合理,但不能用受试者内高分宣称模型能适用于新用户。论文和产品说明必须写清划分层级。
交叉验证也可能重复泄漏
如果先对全部数据完成特征选择或伪迹阈值估计,再做交叉验证,验证折的信息已经参与处理。
每一折都应在训练部分重新估计会受数据影响的步骤。固定的物理单位转换则可以在划分前完成。
深度网络不会自动解决小样本
参数更多的模型可以拟合复杂波形,也更容易记住受试者、设备与会话差异。数据增强只有符合信号机制时才有帮助。
与简单基线比较能够判断复杂模型是否真正增加价值。若提升只存在于单次随机划分,结论应保持谨慎。
校准决定概率是否可用于选择阈值
分类分数排序良好,不代表输出概率与真实发生率一致。不同数据集的基准比例变化时,固定阈值可能产生完全不同结果。
校准曲线和决策阈值应在独立数据上评估。研究分数不能直接转成个体医疗建议。
不确定性需要连接到失败条件
模型输出低置信度时,原因可能是噪声、罕见波形或分布外样本。只给一个不确定数字,仍无法决定下一步。
可以把质量指标、设备来源和模型置信度一起观察,但不要让自动规则替代专业复核。
保存中间结果要有明确目的
缓存滤波后信号可以节省计算,却可能让团队忘记参数已经变化。中间文件应在名称和清单中标出处理阶段。
长期保留哪些中间版本取决于重算成本和复现需求。所有临时数组都归档,反而会让关键版本难以辨认。
降采样之前必须先处理混叠
把高采样率脑电直接抽取为较低采样率,会让高于新奈奎斯特频率的成分折回低频,形成原始信号中不存在的结构。正确流程需要先采用与目标采样率匹配的抗混叠滤波,再执行降采样。
滤波器的过渡带、阶数和相位响应都会留下痕迹。模型若只在一种预处理流水线上训练,可能把这些痕迹当成类别线索。论文和数据卡应记录滤波器类型与关键参数。
比较两套数据时,简单把采样率改成相同数字还不够。电极布局、参考方式、模拟前端和抗混叠设计仍可能不同,这些差异需要进入验证方案。
分段方式会制造隐性的资料泄漏
把同一受试者的连续记录切成许多相邻窗口,再随机分配到训练集和测试集,会让高度相似的片段同时出现在两侧。模型取得的高准确率,可能来自识别个体或记录背景,而非目标状态。
更严格的切分单位通常是受试者、检查场次或采集日期。选择哪一层,应由模型未来面对的新对象决定。目标是服务新受试者,就不能只做窗口级随机切分。
重叠窗口会进一步提高相似度。使用重叠并非错误,但必须先完成组级划分,再在各组内部生成窗口,并明确报告步长与重叠比例。
伪迹不是都能靠自动删除解决
眨眼、肌电、工频和电极接触不良具有不同频谱与空间形态。单一阈值很难同时处理。过度清理可能删除与任务相关的真实脑活动,保留过多又会让模型学习噪声。
独立成分分析、回归与自动分类器都依赖假设。应保留清理前后的质量摘要,并抽样人工查看边界案例。只有报告删除比例和原因,才能判断流程是否稳定。
临床场景中,某些动作伪迹本身与症状或任务相关。把它们全部移除,可能让训练数据偏离真实使用环境。研究问题应先决定哪些成分属于干扰。
外部验证要跨越真正存在的差异
随机留出同一中心的数据只能检验内部泛化。若产品将面对不同设备、年龄或采集人员,外部验证应主动覆盖这些变化,而不是只追求更大的测试样本。
性能下降时,应按设备、中心和信号质量分层观察。总平均值可能掩盖某一群体的明显失败。分层结果能够帮助判断是校准问题、数据不足还是模型目标本身不稳定。
外部数据也不能只在最终阶段使用一次。预先定义主要指标和失败阈值,可以减少看到结果后不断调整规则的诱惑。
评估指标要与实际用途对应
类别不均衡时,准确率可能被常见类别主导。灵敏度、特异度、精确率与校准误差回答不同问题,应根据漏检和误报的实际代价选择主要指标。
同一个模型阈值在不同中心未必保持相同表现。除了曲线下面积,还应报告选定阈值下的结果,并观察信号质量变化是否造成系统性偏移。
模型输出若要辅助人工判断,概率是否可信往往比排名高低更重要。可靠性图与校准评估能够揭示模型是否过度自信。
基线模型可以揭示复杂方法是否真的有效
深度网络表现优异时,仍应与简单频带特征、线性分类器和受试者无关基线比较。若简单方法已经取得相近结果,复杂模型增加的计算成本未必带来实际收益。
基线还可以暴露资料泄漏。一个不应具有预测力的受试者编号或记录顺序若得到异常高分,说明切分或特征处理中可能带入了目标之外的信息。
报告基线时应采用与主模型相同的数据切分和评价指标。不同切分得到的数字不能直接并列,也无法证明复杂方法带来了稳定改善。