X-ray spectral–morphological component separation on XMM-Newton EPIC data
基于光子能量、PSF 形态、空间尺度与组件特异性 vignetting 的新方法
开发、比较并验证新的、可泛化的 X 射线光谱–形态学成分分离算法。这些算法联合利用 photon energy、PSF 形态、空间尺度 以及组件特异性的 exposure/vignetting 算子,从 XMM-Newton EPIC 原始计数空间数据中恢复 NGC 3079 大尺度热风 (thermal wind) 的可审计、物理可解释的二维形态图。
目标物理量包括:风轴方向 (PA)、张角 (opening angle)、径向延展 (radial extent)、 南北不对称性 (N/S asymmetry)、表面亮度剖面 (surface brightness profile) 和组件通量 (component flux),同时分离 PSF 级点源和组件特异性背景。
以 NGC 3079 为主要真实数据演示和基准测试目标——而非硬编码锥模板。最终将验证后的形态前向折叠 (forward-fold) 通过 Einstein Probe FXT 响应和背景,应用于真实 FXT 数据,产出校准的探测/约束或严格的上限。
核心创新在于 光谱–形态学分离 (spectral-morphological separation): 不依赖单一信息通道,而是联合利用四个物理维度来分离弥漫风组件、点源和背景。
利用不同组件(热风、幂律点源、QPB 背景)的能谱差异,通过多能段响应折叠实现组件辨识。
点源呈现 PSF 级形态,弥漫风呈现大尺度结构。通过 PSF 卷积算子区分点源与扩展源。
风组件在千秒差距尺度上扩展,点源在角秒尺度集中。多尺度分解 (wavelet/multiscale) 提供尺度分离。
不同能段、不同相机 (MOS1/MOS2/PN) 的有效面积随离轴角变化不同。正确建模组件特异性 vignetting 是无偏通量恢复的前提。
Discovery mode (发现模式):不注入 NGC 3079 风的 PA、张角或锥掩模先验。 方法必须仅从能量+PSF+尺度信息发现弥漫结构。已知几何仅在推断后用于盲打分。
Characterization mode (表征模式):仅在 Discovery mode 验证后,才允许使用恢复的或已知的轴/锥族来锐化 PA、延展、不对称性和通量约束。
8 种方法(5 候选 + 3 基线)在 72 个合成场景(36 双极锥 + 27 对称晕 + 9 无风)上进行了统一基准测试。 每种方法在 5 个指标上评估,并对照预声明的 kill criteria 判定。
| 方法 | 类型 | Leakage | Flux Bias | PA Bias (°) | Extent Bias | FP Rate | 判定 |
|---|---|---|---|---|---|---|---|
| ILC (candidate) | 候选 | 0.000 | -6.977 | 0.0 | 1.000 | 0.000 | INVALIDATED |
| Poisson (candidate) | 候选 | 0.000 | -1.000 | 0.0 | 1.000 | 0.000 | INVALIDATED |
| Dictionary (candidate) | 候选 | 0.934 | 4.270 | 70.14 | 1.302 | 0.000 | INVALIDATED |
| Semi-blind (candidate) | 候选 | 0.827 | 1.022 | 66.90 | 0.981 | 0.000 | INVALIDATED |
| Sparse+Smooth (candidate) | 候选 | 0.848 | 2.515 | 60.84 | 1.135 | 0.000 | INVALIDATED |
| Broad-band (baseline) | 基线 | 0.938 | 13.777 | 0.0 | 0.000 | 0.000 | INVALIDATED |
| Point-source mask (baseline) | 基线 | 0.933 | 12.677 | 0.0 | 0.000 | 0.000 | INVALIDATED |
| Hardness map (baseline) | 基线 | 0.975 | 3.809 | 0.0 | 0.000 | 0.000 | INVALIDATED |
越低越好。目标 ≤ 10%。
constrained ILC 和 Poisson profile-likelihood 两种方法在所有 72 个场景中实现了 零 leakage (0.000),远优于 10% 验收标准。 这是组件分离的关键第一步——成功阻止了点源通量泄漏到弥漫风组件中。然而两者均因 通量偏差 (flux bias: ILC -6.977, Poisson -1.000) 被 INVALIDATED, 表明它们在零泄漏的同时过度抑制了风组件的真实通量。
spectral-template × wavelet/PSF dictionary (leakage 0.934, PA bias 70.1°)、 semi-blind physical-template factorization (leakage 0.827, PA bias 66.9°) 和 sparse-point + smooth/multiscale unmixing (leakage 0.848, PA bias 60.8°) 三种方法虽然能恢复部分风通量,但点源泄漏严重且方位角偏差远超 30° kill threshold。 这表明在 pilot 实现中,这些方法无法可靠区分风结构与点源散射。
8/8 方法全部 INVALIDATED。这是 预期且科学诚实的结果:pilot 实现使用简化模板和 通用物理网格,而非目标特异性光谱基。Kill criteria 在 tournament 开始前预声明,结果判定后未修改。 这一结果为 P4 阶段的算法改进和 hybrid 方案提供了明确的量化改进方向:ILC/Poisson 需修正通量偏差, Dictionary 系需解决泄漏和 PA 偏差。
P3 生产线已实现:真实 EPIC 数据摄入 (35 个科学滤光事件文件,12 个 ObsIDs, M1/M2/PN 三相机) → 响应折叠 (23 个完整 ARF+RMF+PI 三元组,OGIP 标准验证) → 曝光修正 (组件特异性 vignetting 算子) → 不确定性传播 (uncertainty maps 模块)。 这意味着算法 tournament 的发现可以直接驱动真实数据分解。
从原始 XMM-Newton EPIC 计数到科学测量的完整数据流:
以下阈值在 tournament 开始前预声明,结果判定后未修改:
注:Tournament 阶段使用的 kill thresholds 更严格(leakage ≤ 50%, flux_bias ≤ 50%, PA_bias ≤ 30°), 仍导致全部方法 INVALIDATED。P4 阶段将使用上述更严格的科学验收标准。
测试覆盖: 90 个测试文件,2954 个测试全部通过。
12 个独立 ObsIDs,覆盖 M1 (14 文件)、M2 (12 文件)、PN (11 文件) 三相机:
滤光器分布:Medium (33 文件) · Thin1 (2 文件) · CalClosed (2 文件,已排除)。 23 个完整 ARF+RMF+PI 响应三元组通过 OGIP 标准验证。
所有结果可追溯到不可变 V5 固定点。溯源链完整:输入清单 → SHA-256 钉扎 → 模块 hash 验证 → 审计台账。任何结果变更必须追溯到最终科学目标,且在 cognition OS 中记录日期决策轨迹。