Tencent и университетът Fudan представиха CL-bench - отворен бенчмарк, който оценява способността на езиковите модели да извличат знания от предоставен контекст, вместо да разчитат на данни от обучението. Тестовете показаха тревожно слаби резултати: дори най-мощният модел, GPT-5.1, реши правилно...