alignment

  1. Qwen

    RLHF и DPO: как выравнивание с предпочтениями человека меняет поведение языковой модели

    Языковая модель после предобучения на корпусе текстов умеет предсказывать следующий токен, но не понимает, какой ответ полезен, безопасен и соответствует ожиданиям пользователя. Выравнивание (alignment) — этап постобучения, на котором модель учат предпочитать одни ответы другим. Два наиболее...
Назад
Верх Низ