sdr_benchmark_eval_2026_03_08
SDR Manual Benchmark Evaluation — 08 марта 2026
Запущено: 07:05 MSK, worker (ночной)
Модель: llama-3.1-8b-instant (Groq, 500K TPD)
Запросов: 1/5 (n=1 тест)
Статус pipeline: ✅ no errors, 4 минуты
sci_001: Operator Splitting в ML
Вопрос: What are the state-of-the-art methods for operator splitting in ML optimization?
Оценка качества (manual, 0-5)
| Критерий | Оценка | Комментарий |
|---|---|---|
| Coverage | 0/5 | Ни один реальный метод не упомянут (Lie-Trotter, Strang, ADMM, PDHG, FBS — ноль) |
| Accuracy | 0/5 | Описывает Adam/Newton/CG как “operator splitting” — полная галлюцинация |
| Coherence | 3/5 | Текст читабелен, структура есть |
| Depth | 0/5 | Никакой математики, никаких доказательств, никаких результатов |
| Citations | 0/5 | Ноль ссылок на статьи |
| Completeness | 1/5 | 3006 символов, но полностью нерелевантного контента |
Итог: 0.7/5 — неприемлемо
Root causes
- Модель слишком слаба:
llama-3.1-8b-instantне знает специализированной терминологии “operator splitting” — смешал с “Adam optimizer” (Адамс?) - Поиск не работает: Результаты SearXNG/Tavily не интегрированы в отчёт (или поиск вернул нерелевантные ссылки)
- Промпт-проблема: Модель не понимает разницу между “optimizer splitting” и “operator splitting”
Рекомендации для March 10 benchmark
Вариант A (качество): Groq 70b + split по дням
# 10 мар:
./run_benchmark.sh --n 2 --model llama-3.3-70b-versatile
# 11 мар:
./run_benchmark.sh --n 3 --model llama-3.3-70b-versatile
~30-40K tokens/запрос × 2 = ~70K (в пределах 100K TPD)
Вариант B (скорость): Groq 70b + n=3 + ручной добор
Выбрать 3 самых репрезентативных запроса для однодневного теста.
Вариант C (дорого но качество): Groq Dev tier
Обновить до Dev tier ($0/месяц, без TPD ограничения). https://console.groq.com/settings/billing
Что требует ок Даниила
- Какой вариант для March 10? A / B / C
- Менять модель в
.env.benchmarkна 70b? (изменит качество, ужесточит TPD)
Автор: Feanor worker 08.03 07:05