Опыт построения систем оценки LLM: eval datasets, LLM-as-a-Judge, offline/online evaluation, regression testing и контроль качества ответов. – Выбирать и сравнивать LLM под конкретные сценарии, проводить benchmark- тестирование open-source и API-моделей по качеству, latency, throughput и...
Похожие вакансии
Python Developer — ручной тест
Test Company (manual auto-post) · Remote
Выездной менеджер по продажам дизайн-проектов и ремонтов под ключ
Домострой · Москва
Инженер-наладчик ПТК (инженерные системы)
ПиЭлСи Технолоджи · Москва
Инженер АСУ ТП (Высоковольтные ПС)
ПиЭлСи Технолоджи · Москва
Инженер-наладчик систем телемеханики и АСУ ТП
ПиЭлСи Технолоджи · Москва