Модель разбирала конфликты в чате по логам: что увидела лучше человека, где переврала атрибуцию, как проверять такие выводы до публикации – и что из этого следует для Падавана, бота сообщества.
Спор о том, чем доказывать качество ИИ: прогоном на реальных задачах или perplexity. Как собрать свой эвал-набор и когда вендорские бенчмарки бесполезны.