Обирайте модель на основі доказів
ЗавершеноПорівнюйте моделі за репрезентативними задачами, критеріями приймання, вартістю та робочими обмеженнями команди.
Видавець TaigaЯк ми пишемо
Перевірте своє розумінняМодель A проходить більше задач публічного бенчмарку. Модель B краще виконує репрезентативні задачі вашого репозиторію. Який результат має спрямовувати рішення?Виконайте вправу
Чого ви навчитеся
- Створювати невеликий набір для оцінювання з реальних типів задач.
- Відокремлювати якість моделі від впливу інструментів і контексту.
- Записувати умови, що потребують нового оцінювання.
Визначте рішення
Порівняння моделей потребує конкретного випадку використання. Модель, що добре пояснює невелику функцію, може не так добре впоратися з великою зміною репозиторію. Дешевша модель може відповідати вимогам якості для типових перетворень. Складне дослідження може потребувати кращих можливостей міркування.
Спочатку запишіть задачу й обмеження. Включіть дозволені дані, потрібні інструменти, час відповіді та максимальну прийнятну вартість. Деякі обмеження обов’язкові. Не нівелюйте обмеження обробки даних усередненням оцінок лише тому, що інший бал високий.
Використовуйте репрезентативні задачі
Створіть невеликий набір для оцінювання з роботи, яку команда справді виконує. Вилучіть чутливі дані, якщо середовище оцінювання не погоджене для них. Включіть прості й складні задачі, а також задачі, для яких правильна відповідь — запросити відсутню інформацію.
Для вигаданого сервісу звітності використайте відомий дефект дат, невелику функцію фільтра та пояснення правила авторизації. Підготуйте очікуваний результат до запуску порівняння. Включіть негативний тест, який виявляє відомий дефект.
Залиште частину задач окремо від розробки промпта. Якщо постійно налаштовувати промпт на кожному прикладі, остаточний бал може завищити загальну якість роботи. Окремий набір допомагає з’ясувати, чи працює покращений промпт поза прикладами, на яких його створили.
Забезпечте справедливе порівняння
Запишіть точну версію моделі, промпт, наданий контекст, інструменти та права. Використовуйте рівноцінні початкові стани. Якщо одна модель отримує весь репозиторій, а інша — один файл, результат порівнює робочі процеси разом із моделями.
Порівняння робочих процесів може бути корисним. Правильно його позначайте. Продукт з агентом включає не лише модель: на результат можуть впливати добір контексту, інструменти, обмеження виконання та поведінка відновлення.
Повторюйте запуски, коли варіативність результату важлива. Записуйте невдалі спроби, а не повідомляйте лише найкращий результат. Для суб’єктивних критеріїв використовуйте письмову шкалу оцінювання та, коли це практично, більше одного рецензента.
Оцінюйте якість перед швидкістю
Спочатку перевірте обов’язкові критерії приймання. Чи виконує зміна вимогу? Чи зберігає контроль доступу? Чи проходять відповідні тести? Чи може рецензент зрозуміти diff?
Потім порівняйте трудовитрати, загальний час і вартість прийнятних результатів. Врахуйте повторні спроби та перегляд людиною. Дешева відповідь, що потребує повторних виправлень, може бути дорогою на рівні всієї задачі.
| Поле оцінювання | Що записати |
|---|---|
| Результат задачі | Які критерії приймання виконано, а які ні |
| Обсяг | Незапитані зміни або пропущені вимоги |
| Зусилля людей | Час підготовки, перегляду та виправлення |
| Вартість виконання | Вартість моделі й інструментів, включно з повторними спробами |
| Докази | Версія, вхідні й вихідні дані, перевірки та нотатки рецензента |
Публічні бенчмарки можуть допомогти визначити кандидатів. Вони використовують конкретні набори задач і методи оцінювання. Не сприймайте бал бенчмарку як пряме вимірювання продуктивності команди.
Запишіть рішення та умови його перегляду
Результатом може бути вузька рекомендація. Наприклад: «Використовуйте цю модель для невеликих доповнень тестів у цьому репозиторії, зберігаючи наявні вимоги до перегляду». Одна модель для всіх задач не потрібна.
Вкажіть, що потребуватиме нового оцінювання. Приклади: зміна версії моделі, інша конфігурація інструментів, нова категорія даних або стійке повторення збоїв. Майте запасний варіант для задач, які перевищують можливості вибраної моделі.
Мета оцінювання — зменшити невизначеність щодо реального рішення. Уникайте постійного змагання моделей, яке забирає більше зусиль, ніж робота, яку воно підтримує.
Виконайте вправу
Створіть аркуш оцінювання для трьох типів задач: відомого дефекту, невеликої функції та пояснення репозиторію. Визначте критерії приймання перед порівнянням моделей. Включіть один випадок відмови для кожної задачі. Запишіть версію моделі, контекст, права інструментів, спроби, вартість і зусилля на перегляд.
Завантажити робочий аркуш (Markdown)Зняття цієї позначки видаляє весь прогрес, збережений у цьому браузері.
Прогрес залишається в цьому браузері. Без облікового запису та відстеження.