Оценяването на AI модели става все по-трудно, защото част от тестовете може вече да са попаднали в обучаващите данни или да са повлияли на самото разработване на модела. Затова се експериментира с double-blind подходи, при които задачите остават скрити до момента на оценяването.

Колкото по-добри стават моделите, толкова по-трудно става да разберем дали тестовете всъщност измерват това, което мислим.