为什么传统AI评估会失败?uncertain_ground_truth的统计聚合模型给出答案

发布时间:2026/8/7 18:22:46
为什么传统AI评估会失败?uncertain_ground_truth的统计聚合模型给出答案 为什么传统AI评估会失败uncertain_ground_truth的统计聚合模型给出答案【免费下载链接】uncertain_ground_truthDermatology ddx dataset, Jax implementations of Monte Carlo conformal prediction, plausibility regions and statistical annotation aggregation from our recent work on uncertain ground truth (TMLR23 and ArXiv pre-print).项目地址: https://gitcode.com/gh_mirrors/un/uncertain_ground_truth在AI系统的开发过程中评估和校准是确保其安全性和可靠性的关键环节。传统方法通常假设存在确定的ground truth真实标签作为评估基准但在许多实际场景中这种假设并不成立。uncertain_ground_truth项目通过创新的统计聚合模型揭示了传统AI评估失败的核心原因并提供了一套完整的解决方案。传统AI评估的致命缺陷忽视真实世界的不确定性传统AI评估流程依赖于确定性的标签聚合方法如多数投票或平均这种做法存在两大根本性问题1. 掩盖标注不确定性Annotation Uncertainty当多位专家对同一案例存在分歧时如皮肤病诊断中不同医生的差异化判断简单的多数投票会抹平这些关键差异。项目中的dermatology_selectors.json数据展示了专家标注的部分排序特性例如[Hemangioma], [Melanocytic Nevus, Melanoma, O/E]这种结构化标注包含丰富的不确定性信息却被传统方法简化为单一标签。2. 忽略固有不确定性Inherent Uncertainty许多领域如医学影像、自然语言处理的真实标签本身具有模糊性。传统评估将模型预测与伪真实标签比较导致性能被严重高估。项目在皮肤疾病分类案例中证明基于逆秩归一化IRN的评估会使模型性能虚高且无法提供有意义的不确定性估计。uncertain_ground_truth的创新解决方案三大核心技术统计标注聚合Statistical Annotation Aggregation通过构建概率模型对多源标注进行聚合生成反映真实不确定性的plausibility似然度分布。核心实现位于p_value_combination.py和irn.py通过以下步骤实现建模标注者可靠性超参数将标注视为部分排序关系通过后验推断生成类别概率分布蒙特卡洛 conformal predictionMonte Carlo Conformal Prediction传统conformal prediction依赖确定的校准集标签而项目提出的蒙特卡洛方法直接利用似然度采样伪标签。关键代码在monte_carlo.py中实现核心思想是# 蒙特卡洛conformal prediction校准阈值 def calibrate_monte_carlo(plausibilities, conformity_scores, alpha): Calibrates a threshold using Monte Carlo conformal prediction. # 采样伪标签并计算一致性分数 # ... return threshold这种方法确保预测集覆盖真实标签的概率达到用户指定水平而非仅覆盖多数投票标签。似然区域Plausibility Regions通过网格搜索构建覆盖高似然度类别的预测区域实现更精细的不确定性量化。plausibility_regions.py提供了完整实现支持动态阈值校准Top-K置信集缩减覆盖度与精确率平衡实战验证皮肤病诊断案例研究项目的dermatology ddx dataset包含1947个皮肤病案例的专家标注和模型预测实证研究表明传统方法失效基于IRN的评估将模型准确率高估15-20%且无法反映诊断风险见data/dermatology_risks.txt蒙特卡洛CP优势在90%目标覆盖率下传统CP对专家标注的实际覆盖率仅为72%而蒙特卡洛CP达到89%显著缩小覆盖缺口不确定性可视化通过colab_mccp.ipynb可生成似然区域热力图直观展示模型预测的不确定性边界快速开始如何使用uncertain_ground_truth环境配置git clone https://gitcode.com/gh_mirrors/un/uncertain_ground_truth cd uncertain_ground_truth conda env create -f environment.yml conda activate uncertain_ground_truth核心功能体验运行colab_toy_data.ipynb生成带标注不确定性的玩具数据集使用colab_mccp.ipynb对比传统CP与蒙特卡洛CP的覆盖性能通过colab_ua_accuracy.ipynb计算不确定性调整后的准确率结语重新定义AI评估的黄金标准在医疗诊断、自动驾驶等高风险领域忽视ground truth不确定性可能导致灾难性后果。uncertain_ground_truth项目通过将统计聚合模型与conformal prediction结合首次实现了在不确定标注条件下的可靠评估与校准。其开源的dermatology ddx dataset更为相关研究提供了宝贵的基准资源。随着AI系统日益复杂拥抱不确定性将成为构建安全AI的核心原则。uncertain_ground_truth的创新方法为这一方向提供了可落地的技术框架值得每一位AI从业者关注和实践。【免费下载链接】uncertain_ground_truthDermatology ddx dataset, Jax implementations of Monte Carlo conformal prediction, plausibility regions and statistical annotation aggregation from our recent work on uncertain ground truth (TMLR23 and ArXiv pre-print).项目地址: https://gitcode.com/gh_mirrors/un/uncertain_ground_truth创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考