Метрики объяснимости

Объяснимый ИИ на Python

Fouad Trad

Machine Learning Engineer

Согласованность

  • Оценивает стабильность объяснений при обучении модели на разных подвыборках
  • Низкая согласованность → объяснения ненадёжны

Изображение набора данных, разделённого на две подвыборки: подвыборка 1 и подвыборка 2.

Объяснимый ИИ на Python

Согласованность

  • Оценивает стабильность объяснений при обучении модели на разных подвыборках
  • Низкая согласованность → объяснения ненадёжны

Модель обучается на каждой подвыборке.

Объяснимый ИИ на Python

Согласованность

  • Оценивает стабильность объяснений при обучении модели на разных подвыборках
  • Низкая согласованность → объяснения ненадёжны

При каждом обучении модели на подвыборке вычисляется важность признаков и косинусное сходство.

Объяснимый ИИ на Python

Косинусное сходство для измерения согласованности

 

 

 

Изображение ключевых значений согласованности и их смысла: значение 1 означает высокую согласованность объяснений.

Объяснимый ИИ на Python

Косинусное сходство для измерения согласованности

 

 

 

Изображение ключевых значений согласованности и их смысла: 1 — высокая согласованность объяснений, 0 — согласованность отсутствует.

Объяснимый ИИ на Python

Косинусное сходство для измерения согласованности

 

 

 

Изображение ключевых значений согласованности и их смысла: 1 — высокая согласованность, 0 — согласованность отсутствует, -1 — противоположные объяснения.

Объяснимый ИИ на Python

Набор данных о поступлении

GRE Score TOEFL Score University Rating SOP LOR CGPA Chance of Admit
337 118 4 4.5 4.5 9.65 0.92
324 107 4 4 4.5 8.87 0.76
316 104 3 3 3.5 8 0.72
322 110 3 3.5 2.5 8.67 0.8
314 103 2 2 3 8.21 0.45

 

  • X1, y1: первая часть набора данных
  • X2, y2: вторая часть набора данных
  • model1, model2: регрессоры на основе случайного леса
Объяснимый ИИ на Python

Вычисление согласованности

from sklearn.metrics.pairwise import cosine_similarity

explainer1 = shap.TreeExplainer(model1) explainer2 = shap.TreeExplainer(model2)
shap_values1 = explainer1.shap_values(X1) shap_values2 = explainer2.shap_values(X2)
feature_importance1 = np.mean(np.abs(shap_values1), axis=0) feature_importance2 = np.mean(np.abs(shap_values2), axis=0)
consistency = cosine_similarity([feature_importance1], [feature_importance2]) print("Consistency between SHAP values:", consistency)
Consistency between SHAP values: [[0.99706516]]
Объяснимый ИИ на Python

Достоверность

  • Оценивает, влияют ли важные признаки на предсказания модели
  • Низкая достоверность → вводит в заблуждение при оценке модели
  • Важна в чувствительных приложениях

Изображение модели, генерирующей исходное предсказание для входного примера.

Объяснимый ИИ на Python

Достоверность

  • Оценивает, влияют ли важные признаки на предсказания модели
  • Низкая достоверность → вводит в заблуждение при оценке модели
  • Важна в чувствительных приложениях

SHAP или LIME используются для локального объяснения исходного предсказания.

Объяснимый ИИ на Python

Достоверность

  • Оценивает, влияют ли важные признаки на предсказания модели
  • Низкая достоверность → вводит в заблуждение при оценке модели
  • Важна в чувствительных приложениях

Изменённый пример подаётся в модель для получения нового предсказания.

Объяснимый ИИ на Python

Достоверность

  • Оценивает, влияют ли важные признаки на предсказания модели
  • Низкая достоверность → вводит в заблуждение при оценке модели
  • Важна в чувствительных приложениях

Изображение формулы вычисления достоверности как абсолютного значения разности нового и исходного предсказаний.

Объяснимый ИИ на Python

Вычисление достоверности

X_instance = X_test.iloc[[0]]

original_prediction = model.predict_proba(X_instance)[0, 1] print(f"Original prediction: {original_prediction}")
Original prediction: 0.43

Изображение объяснения важности признаков от LIME для выбранного примера.

Объяснимый ИИ на Python

Вычисление достоверности

X_instance['GRE Score'] = 310  


new_prediction = model.predict_proba(X_instance)[0, 1] print(f"Prediction after perturbing {important_feature}: {new_prediction}")
faithfulness_score = np.abs(original_prediction - new_prediction) print(f"Local Faithfulness Score: {faithfulness_score}")
Prediction after perturbing GRE Score: 0.77

Local Faithfulness Score: 0.34
Объяснимый ИИ на Python

Давайте потренируемся!

Объяснимый ИИ на Python

Preparing Video For Download...