Pablo Zavala · Évaluation de sécurité IA · Ingénierie de recherche

Laboratoire d'évaluation RAG

Banc d'essai comparant des chaînes RAG de base et réordonnées avec métriques RAGAS et SQuAD sur Mini Wikipedia. La chaîne réordonnée atteint 86,6 % de précision contextuelle, mais perd en correspondance exacte.

Précision de l'affirmation

Ce que les preuves démontrent
86,6 % de précision contextuelle après réécriture de requêtes et réordonnancement; correspondance exacte en baisse sur la partition complète de 918 requêtes
Frontière des capacités et des preuves
L'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.

Banc d'essai public d'évaluation

Rôle: Concepteur du banc d'essai : variantes de récupération, métriques, intervalles de confiance et rapport.

Carte d'évaluation

Résultat principal

Échantillon
Banc d'essai public d'évaluation
Correcteur
Comparaison avec l'affirmation publique et ses artefacts de preuve
Résultat
86,6 % de précision contextuelle après réécriture de requêtes et réordonnancement; correspondance exacte en baisse sur la partition complète de 918 requêtes
Périmètre de vérification
L'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.

Signal de preuve

Échantillon
Précision contextuelle de 69,0 % à 86,6 % avec réécriture de requêtes et réordonnancement
Correcteur
Lecture de dépôts, rapports, données versionnées ou démos publiques
Résultat
Fidélité de 67,6 % à 78,5 % sur la même tranche d'évaluation
Périmètre de vérification
L'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.
Axes d'évaluation avec échantillon, correcteur, résultat et périmètre de vérification.
AxeÉchantillonCorrecteurRésultatPérimètre de vérification
Résultat principalBanc d'essai public d'évaluationComparaison avec l'affirmation publique et ses artefacts de preuve86,6 % de précision contextuelle après réécriture de requêtes et réordonnancement; correspondance exacte en baisse sur la partition complète de 918 requêtesL'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.
Signal de preuvePrécision contextuelle de 69,0 % à 86,6 % avec réécriture de requêtes et réordonnancementLecture de dépôts, rapports, données versionnées ou démos publiquesFidélité de 67,6 % à 78,5 % sur la même tranche d'évaluationL'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.

Comment inspecter ce travail

Question évaluée

Banc d'essai comparant des chaînes RAG de base et réordonnées avec métriques RAGAS et SQuAD sur Mini Wikipedia. La chaîne réordonnée atteint 86,6 % de précision contextuelle, mais perd en correspondance exacte.

Preuve inspectable

Preuve principale : 86,6 % de précision contextuelle après réécriture de requêtes et réordonnancement; correspondance exacte en baisse sur la partition complète de 918 requêtes. Surface : Banc d'essai public d'évaluation.

Frontière des capacités et des preuves

L'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.

Étude de cas

Problème

Banc d'essai comparant des chaînes RAG de base et réordonnées avec métriques RAGAS et SQuAD sur Mini Wikipedia. La chaîne réordonnée atteint 86,6 % de précision contextuelle, mais perd en correspondance exacte.

Contexte

Le banc d'essai compare une chaîne naïve de récupération top-one à une chaîne améliorée avec réécriture de requêtes orientée rappel et réordonnancement cross-encoder.

Méthode

Rôle de Pablo : Concepteur du banc d'essai : variantes de récupération, métriques, intervalles de confiance et rapport. Métriques RAGAS, Métriques SQuAD, Réordonnancement cross-encoder

Résultat

86,6 % de précision contextuelle après réécriture de requêtes et réordonnancement; correspondance exacte en baisse sur la partition complète de 918 requêtes Précision contextuelle de 69,0 % à 86,6 % avec réécriture de requêtes et réordonnancement

Périmètre de vérification

L'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.

Preuve

Banc d'essai public d'évaluation La preuve principale se trouve dans les liens de la section matériaux.

Résultats clés

  • Précision contextuelle de 69,0 % à 86,6 % avec réécriture de requêtes et réordonnancement
  • Fidélité de 67,6 % à 78,5 % sur la même tranche d'évaluation
  • Correspondance exacte en baisse statistiquement significative sur la partition complète

Méthodes

  • Métriques RAGAS
  • Métriques SQuAD
  • Réordonnancement cross-encoder
  • Intervalles de confiance Wilson