Полный текст
Размышления о высококачественных данных, собранных людьмиВысококачественные данные — это «топливо» для современных моделей глубокого обучения. Большая часть данных, размеченных под конкретные задачи, создаётся живыми людьми — аннотаторами, которые занимаются классификацией или проводят RLHF-разметку для LLM alignment. Многие из представленных в этой публикации методов машинного обучения могут помочь улучшить качество данных, но главным остаётся внимание к деталям и скрупулёзность.Сообщество разработчиков машинного обучения осознаёт ценность высококачественных данных, но почему-то складывается впечатление, что «все хотят работать над моделями, а не над данными».