Блог
Новости
Устойчивый к ИИ дизайн оценивания: выводы PISA 2025
PISA 2025 рассказывает об использовании и обучении ИИ и о том, как учреждения могут разрабатывать справедливые, устойчивые к ИИ оценки, не полагаясь только на обнаружение.
Оркен Рахматулла
Руководитель образования

PISA 2025 не показывает, что каждое использование ИИ вредит обучению. Это показывает более полезную модель. Результаты студентов различаются по тому, почему, как часто и насколько критически они используют ИИ. Для владельцев экзаменов смысл ясен: целостность оценки в 2026 году не может быть сведена к запрету инструмента или запуску детектора ИИ. Институты нуждаются в оценках, которые делают достоверные доказательства обучения видимыми.
ОЭСР опубликовала результаты PISA 2025 в сентябре 2026 года, предоставив своевременное представление о том, как учащиеся используют чат-боты ИИ для школьной работы и как эти шаблоны связаны с производительностью. Результаты следует рассматривать как ассоциации, а не как доказательство того, что использование ИИ вызывает определенный результат. Тем не менее, они дают лидерам образования прочную основу для пересмотра политики, оценки и надзора.
Что говорит PISA 2025 об использовании студентом ИИ
Использование ИИ для школьной работы широко распространено в странах-участницах.
В среднем в странах ОЭСР 14% учащихся сообщили, что никогда или почти никогда не использовали ИИ для каких-либо изученных школьных целей.
Студенты, которые не использовали ИИ для конкретных задач, таких как обобщение текстов или предварительные исследования, в целом превосходили пользователей во многих странах и экономиках.
Для некоторых учебных целей умеренное или еженедельное использование было связано с результатами, аналогичными или немного лучше, чем неиспользование, в то время как очень частое использование часто было связано с более низкой производительностью.
Студенты, которые научились оценивать качество информации, генерируемой ИИ, показали более позитивные закономерности, но доступ к этому обучению был неравномерным.
Эти результаты не подтверждают простой вывод «ИИ хорош» или «ИИ плох». Они поддерживают различие между ИИ, который помогает студенту думать, и ИИ, который заменяет мышление.
Что означают выводы для оценки целостности
1.Отполированный результат является более слабым доказательством, чем раньше
Генеративный ИИ может производить беглые эссе, резюме, код, изображения и объяснения. Когда оценка оценивает только конечный артефакт, может быть трудно отличить продемонстрированную компетентность от делегированного производства. Ответ заключается не в том, чтобы считать, что каждый сильный ответ является подозрительным. Это сбор лучших доказательств.
2. Политика ИИ должна быть привязана к результатам обучения
Если целью является отзыв без посторонней помощи или независимое рассуждение, доступ ИИ может аннулировать задачу и должен быть ограничен. Если целью является оценка доказательств, критика результатов ИИ или ответственное использование профессиональных инструментов, контролируемое использование ИИ может быть целесообразным. Политика должна указывать допустимый уровень, требуемое раскрытие и доказательства, ожидаемые от студента.
3. Обнаружение само по себе не может сохранить действительность
ИИ-текстовые детекторы не могут надежно реконструировать то, как был получен ответ, а мониторинг устройств не может наблюдать за каждым выходом за пределы платформы. Обнаружение может идентифицировать сигналы риска, но правильная оценка требует выбора дизайна, который делает процесс, суждение и личность студента наблюдаемыми.
Пять принципов проектирования ИИ-устойчивой оценки
1.Начните с утверждения, что результат должен поддерживать
Напишите одно предложение, описывающее, что должен доказать результат. Затем спросите, какие доказательства останутся убедительными, если у кандидата будет доступ к мощному помощнику ИИ. Это сдвигает разговор о дизайне от полицейского инструмента к защите значения учетных данных.
2.Использовать конкретный контекст и исходные данные
В рекомендациях Ofqual от 2026 года отмечается, что задачи, связанные с конкретным контекстом, набором данных или проблемой, могут быть менее восприимчивы к генерируемым ИИ ответам. Используйте локальные случаи, оригинальные наблюдения, уникальные данные, постановочную информацию или специфические ограничения. Специфика не является гарантией, но она делает делегирование общих данных менее эффективным и повышает качество доказательств.
3.Оценить процесс, а также продукт
Собирайте планы, промежуточные вычисления, историю версий, заметки из источников, короткие размышления, демонстрации или устные защиты, где они имеют отношение к результатам обучения. Не добавляйте артефакты процесса в бюрократию. Выберите наименьший набор, который поможет рецензенту понять, как кандидат достиг результата.
4. Добавить контролируемые контрольно-пропускные пункты, где последствия высоки
Короткое живое объяснение, контролируемая практическая задача, экзамен, удостоверяющий личность, или прокторированное валидационное упражнение могут подтвердить, может ли кандидат воспроизвести или защитить компетентность, показанную в неконтролируемой работе. Чем выше следствие ложного результата, тем сильнее должно быть это подтверждение.
5. Обучение критической грамотности ИИ
PISA 2025 подчеркивает ценность обучения для оценки информации, генерируемой ИИ. Студенты должны практиковать проверку доказательств, выявление неопределенности, сравнение источников, документирование подсказок или помощи, где это необходимо, и принятие ответственности за окончательную работу. Целостность улучшается, когда политика отличает прозрачную помощь от искажения.
Простая трехзонная политика ИИ
Красная зона: требуется независимое исполнение
Никакой генеративной ИИ или несанкционированной внешней помощи. Используйте эту зону для навыков, которые должны быть продемонстрированы без поддержки, проверки знаний с высокой значимостью, решений о лицензировании или контролируемой проверки предыдущей работы. Укажите точно разрешенные инструменты и применяйте пропорциональный надзор.
Янтарная зона: ограниченная помощь ИИ с раскрытием информации
Разрешить определенные действия, такие как мозговой штурм, поддержка грамматики, перевод или обратная связь, требуя, чтобы кандидат использовал документ и оставался ответственным за точность. Оцените основные аргументы и доказательства, а не только пол результата.
Зеленая зона: использование ИИ является частью оцениваемой компетенции
Пусть кандидаты открыто используют ИИ и оценивают оперативную стратегию, проверку, суждение, экспертизу домена и возможность улучшить или отклонить выход ИИ. Оценка должна выявить то, что студент понимает и может защитить.
Когда прокторинг подходит
Прокторинг наиболее полезен, когда учреждение нуждается в контролируемых доказательствах независимой деятельности: приеме, профессиональной сертификации, лицензировании, окончательной валидации конечного результата или контролируемом контрольном пункте в более широкой оценке. Это не должно быть автоматическим ответом на каждое задание.
Там, где прокторинг оправдан, сочетайте чёткие правила, удостоверение личности, контроль устройств и окружающей среды, многосигнальный мониторинг, проверку специалистом, гарантии конфиденциальности, размещение и обращения. Настройка уровня контроля на ставки вместо применения максимальных ограничений для каждого ученика.
Последовательность внедрения для учреждений
Инвентарные оценки путем изучения результатов и последствий недействительного результата.
Назначение каждой задачи в красную, янтарную или зеленую зону использования ИИ.
Перепроектировать задачи с высоким риском для сбора процессуальных, контекстных или контролируемых доказательств.
Публикуйте примеры разрешенного и запрещенного использования ИИ.
Выберите пропорциональный контроль идентичности и целостности для контролируемых контрольных точек.
Обучить преподавателей и рецензентов оценивать доказательства без чрезмерной зависимости от автоматических флагов.
Измерьте завершение кандидата, потребности в поддержке, исключения из доступности, соглашение рецензента, апелляции и результаты обучения.
Проанализируйте политику как возможности ИИ и официальные изменения руководства.
Часто задаваемые вопросы
Доказывает ли PISA 2025, что ИИ снижает успеваемость студентов?
PISA сообщает о связи между моделями использования ИИ и производительностью. Связь варьируется в зависимости от цели и частоты, и результаты не устанавливают простой причинно-следственной связи.
Что такое ИИ-устойчивая оценка?
Это оценка, предназначенная для получения достоверных доказательств компетентности, даже если генеративный ИИ широко доступен. Он разъясняет допустимое использование, собирает правильные доказательства и затрудняет несанкционированную делегацию для замены оцениваемого навыка.
Являются ли устные экзамены единственным вариантом ИИ?
Нет. Полезные подходы включают конкретные контекстуальные задачи, исходные данные, постановочные проблемы, доказательства процесса, практические демонстрации, контролируемые контрольно-пропускные пункты, устные наблюдения и оценки, где ответственное использование ИИ само по себе является частью компетенции.
Должны ли университеты запрещать ИИ во всех оценках?
Общий запрет игнорирует разницу между результатами обучения. Некоторые задачи требуют без посторонней помощи; другие должны обучать и оценивать ответственное использование ИИ. Политика на уровне задач более ясна и более оправдана, чем одно правило для каждого контекста.
Источники и дальнейшее чтение
Оркен Рахматулла
Руководитель образования
Поделиться


