数组有序、元素∈[0,1],目标区间满足两个核心约束:
- 区间内部波动小、曲线平滑;
- 区间内数值整体趋近1(均值/中位数高); 区间长度无固定限制,自适应最优分段。
前置基础指标(所有筛选方法共用计算量)
设候选区间子序列 ,长度
- 高值衡量指标
- 区间均值 (越大越靠近1)
- 区间中位数 (抗异常跳变,优先推荐)
- 大于0.8/0.9的占比 (t自定义阈值如0.9)
- 平滑/低波动衡量指标
- 标准差 (越小越平稳)
- 极差 (全局波动幅度)
- 相邻差分波动 (一阶差分均值,最贴合“曲线平滑”)
- 二阶差分(曲率),衡量曲线弯折程度
- 综合打分函数(核心,平衡两个目标) 通用归一化打分公式(值域0~1,越高越优): 权重可调:优先高值则调大,优先平滑调大。
一、滑动窗口遍历筛选法(最通用、工程首选)
原理
用可变/固定长度滑动窗口遍历整个有序数组,对每个窗口计算综合得分,保留最高分区间。
两类实现方案
方案1:可变长度滑动窗口(适配任意区间长度需求)
- 设定窗口最小长度 (避免单点无意义区间,如L≥3);
- 双重循环遍历所有合法区间起点i、终点j ();
- 对每个区间计算:均值、差分波动、综合Score;
- 记录全局Score最大值对应的,即为最优特征区间。
方案2:多固定长度窗口融合
- 设置多组窗口长度:短窗口(L=5)、中窗口(L=20)、长窗口(L=50);
- 分别滑动求各长度下最优区间;
- 交叉对比:优先选择均值高+差分波动最低的区间。
优缺点
- 优点:逻辑简单、可落地代码、结果全局最优;有序数组天然适配,无需排序;
- 缺点:数组极长时双重循环计算量大,需预计算前缀和、前缀差分加速。
加速优化:前缀数组预处理
- 前缀和数组:快速求任意区间均值;
- 前缀绝对差分数组:快速求区间平均波动D; 单次窗口指标计算 O(1),整体复杂度降至O(N)。
二、基于分段平稳检测的分割筛选法(大数据长数组专用)
原理
有序序列按波动突变点分割为若干平稳子段,再从所有平稳段中挑选均值最接近1的段。
步骤
- 计算全数组一阶差分序列 ;
- 设置波动阈值:差分超过判定为突变分割点;
- 按分割点切割数组,生成若干独立平稳子区间;
- 过滤掉长度不足的短段;
- 对剩余平稳段按区间均值降序排序,取第一名作为目标区间。
进阶改进:自适应波动阈值
不固定,取全差分序列的分位数(如75%分位数作为突变阈值),适配不同数组分布。
优缺点
- 优点:大幅减少候选区间数量,计算速度远快于全遍历;天然剔除剧烈波动片段;
- 缺点:容易丢失跨突变点但整体综合得分更高的区间。
三、聚类分段筛选法(数值分层+平稳性双重约束)
原理
同时满足“数值靠近1”和“波动小”两个条件,用一维聚类划分高值平稳区域。
步骤
- 筛选高值基础子集:先提取所有(t=0.8~0.9)的索引;
- 对高值索引做连续分段,断开处为数值突降点;
- 对每一段高值连续区间计算波动指标(差分均值D);
- 在高值段中选取D最小、最平滑的区间。
拓展:K-Means一维聚类
- 将数组元素聚类为2类:高值簇(≈1)、低值簇(≈0);
- 提取高值簇连续连片;
- 连片内再按波动筛选最优子区间。
优缺点
- 优点:优先保证数值贴近1,再约束平滑,贴合业务需求;
- 缺点:若高值区域全部剧烈波动,会无合格区间,需调低阈值t。
四、多项式拟合残差平滑筛选法(高精度、曲线平滑度严格要求场景)
原理
用低阶多项式拟合区间序列,残差越小代表曲线越平滑;结合拟合均值靠近1打分。
步骤
- 滑动取候选区间,对区间做1/2阶最小二乘拟合;
- 计算拟合残差(残差越小越平滑);
- 综合得分:;
- 最高分区间输出。
适用场景
对“平滑”要求极高,不能有明显起伏、阶梯跳变的特征提取场景。
优缺点
- 优点:精准量化曲线平顺程度,比差分更贴合视觉平滑效果;
- 缺点:拟合计算开销大,长数组效率低。
五、动态规划最优区间搜索法(全局最优、复杂权重平衡)
原理
构造DP数组,代表以j为区间终点的最优区间综合得分,递推遍历所有起点。
递推公式
同步记录每个j对应的最优起点i,最终全局最大值对应的[i,j]即为解。
优缺点
- 优点:线性复杂度O(N),长数组高性能;全局最优解;可灵活增减评价指标;
- 缺点:代码实现复杂度高于滑动窗口。
六、分位数约束筛选法(稳健抗异常跳变)
原理
利用分位数剔除区间内极端低值、极端跳变,保证主体数值贴近1且波动可控。
筛选规则(区间同时满足)
- 区间上四分位数 (大部分数值靠近1);
- 区间四分位距 (数值集中、波动小);
- 区间相邻差分90%分位数 (极少大幅跳变)。 遍历所有区间,筛选同时满足三条约束的候选,从中取均值最大区间。
优缺点
- 优点:不受个别异常低点、尖峰干扰,鲁棒性强;
- 缺点:约束阈值调参成本高。
七、移动平均平滑前置预处理法(预处理降噪后再选区间)
流程
- 对原有序数组做滑动平均降噪(窗口3/5),得到平滑序列;
- 在平滑序列上执行滑动窗口筛选,优先选取均值最高、波动最小区间;
- 将区间映射回原始数组作为最终特征区间。
适用场景
原始数组存在高频微小噪声,需要先抹平再提取区间。
八、多目标帕累托最优筛选(无明确权重、平衡双目标)
当无法确定高值和平滑的权重时使用:
- 遍历所有合法区间,得到每个区间二元指标:(均值μ,波动D);
- 帕累托筛选:剔除被其他区间完全支配的解(存在区间μ更大且D更小);
- 在帕累托前沿集合中人工/自动选取最优区间(如μ最大、D最小折中)。
优缺点
- 优点:不依赖人为权重,客观给出全部最优候选;
- 缺点:候选区间多,需二次筛选。
各方法选型总结表
| 方法 | 优势场景 | 核心特点 | 计算成本 |
|---|---|---|---|
| 可变滑动窗口 | 中小数组、快速落地 | 全局最优,实现简单 | 中 |
| 分段突变分割 | 超长有序数组 | 快速筛除波动段 | 低 |
| 聚类分层筛选 | 优先保证数值接近1 | 先锁高值再控平滑 | 低 |
| 多项式拟合残差 | 高精度平滑要求 | 量化曲线弯曲程度 | 高 |
| 动态规划 | 超大数组、实时计算 | 线性复杂度 | 低 |
| 分位数约束 | 存在异常跳变噪声 | 稳健、抗离群点 | 中 |
| 移动平均预处理 | 原始序列高频噪声多 | 先降噪再提取 | 中 |
| 帕累托多目标 | 无固定权重、需折中 | 输出全部最优候选 | 高 |
落地实操推荐流程(通用标准流水线)
- 预处理:计算差分序列,可选移动平均降噪;
- 候选区间生成:优先「分段突变分割」快速缩小候选集;
- 指标计算:区间均值、平均相邻差分、高值占比;
- 综合打分筛选;
- 校验:输出区间极差、二阶差分,确认平滑度达标;
- 备选:若无合格区间,调低高值阈值或放宽波动约束。
- 本文链接: https://de30eeab.hugo-ceazer-02.pages.dev/posts/feature-interval-selection/
- 版权声明: 本站所有文章除特别声明外,均采用 CC BY-NC-SA 许可协议。
