Partir de la réalité linguistique
Les processus de la région MENA peuvent combiner arabe standard moderne, dialectes, français, anglais, translittération et vocabulaire spécialisé dans une même tâche. L'évaluation doit d'abord décrire qui communique, quels documents sont utilisés et où se produisent les changements de langue.
- Cartographier les langues par utilisateur et processus
- Inclure dialectes et translittération lorsqu'ils sont pertinents
- Préserver la terminologie métier dans la conception des tests
Mesurer la tâche, pas le modèle isolément
La qualité de recherche, l'ancrage dans les sources, la fidélité des citations, la précision d'extraction et le refus approprié peuvent compter davantage qu'un score générique. Les critères doivent correspondre à la décision ou au service soutenu par le système.
Construire un corpus d'évaluation gouverné
Les exemples représentatifs exigent provenance, règles d'accès, versionnage et revue. Un petit ensemble bien gouverné qui reflète les cas limites réels peut être plus instructif qu'une vaste évaluation publique déconnectée de l'institution.
- Consigner la provenance et les usages autorisés
- Versionner les exemples et comportements attendus
- Réexaminer la couverture avec l'évolution des processus et des langues
Maintenir une supervision humaine responsable
Pour les processus à fort impact, l'évaluation doit inclure l'escalade et la revue humaine, pas seulement un score automatisé. L'objectif est de savoir où le système assiste de façon fiable, où il doit s'abstenir et comment un opérateur peut examiner son résultat.