什么是模型可解释性?
模型可解释性(Model Interpretability)是研究如何理解和解释 AI 模型内部工作机制及决策原因的领域。随着 AI 系统在医疗诊断、信贷审批、司法判决等关键领域广泛应用,模型可解释性变得越来越重要。
为什么可解释性很重要?
建立信任、发现偏见、合规要求(如欧盟 AI 法案)、调试改进。
可解释性的方法
内在可解释性:使用本身可解释的模型(如决策树、线性回归)。事后解释:对已训练好的复杂模型进行分析,包括 LIME、SHAP、注意力可视化等方法。
可解释性 vs 性能
深度神经网络的一个核心矛盾是:性能越好的模型,往往越复杂、越难解释。如何在模型性能和可解释性之间取得平衡,是当前研究的热点方向。