Strategy/projects/files/sdr/sdr_benchmark_eval_2026_03_08.md
+

sdr_benchmark_eval_2026_03_08

SDR Manual Benchmark Evaluation — 08 марта 2026

Запущено: 07:05 MSK, worker (ночной)
Модель: llama-3.1-8b-instant (Groq, 500K TPD)
Запросов: 1/5 (n=1 тест)
Статус pipeline: ✅ no errors, 4 минуты


sci_001: Operator Splitting в ML

Вопрос: What are the state-of-the-art methods for operator splitting in ML optimization?

Оценка качества (manual, 0-5)

Критерий Оценка Комментарий
Coverage 0/5 Ни один реальный метод не упомянут (Lie-Trotter, Strang, ADMM, PDHG, FBS — ноль)
Accuracy 0/5 Описывает Adam/Newton/CG как “operator splitting” — полная галлюцинация
Coherence 3/5 Текст читабелен, структура есть
Depth 0/5 Никакой математики, никаких доказательств, никаких результатов
Citations 0/5 Ноль ссылок на статьи
Completeness 1/5 3006 символов, но полностью нерелевантного контента

Итог: 0.7/5 — неприемлемо

Root causes

  1. Модель слишком слаба: llama-3.1-8b-instant не знает специализированной терминологии “operator splitting” — смешал с “Adam optimizer” (Адамс?)
  2. Поиск не работает: Результаты SearXNG/Tavily не интегрированы в отчёт (или поиск вернул нерелевантные ссылки)
  3. Промпт-проблема: Модель не понимает разницу между “optimizer splitting” и “operator splitting”

Рекомендации для March 10 benchmark

Вариант A (качество): Groq 70b + split по дням

# 10 мар:
./run_benchmark.sh --n 2 --model llama-3.3-70b-versatile
# 11 мар:
./run_benchmark.sh --n 3 --model llama-3.3-70b-versatile

~30-40K tokens/запрос × 2 = ~70K (в пределах 100K TPD)

Вариант B (скорость): Groq 70b + n=3 + ручной добор

Выбрать 3 самых репрезентативных запроса для однодневного теста.

Вариант C (дорого но качество): Groq Dev tier

Обновить до Dev tier ($0/месяц, без TPD ограничения). https://console.groq.com/settings/billing


Что требует ок Даниила

  • Какой вариант для March 10? A / B / C
  • Менять модель в .env.benchmark на 70b? (изменит качество, ужесточит TPD)

Автор: Feanor worker 08.03 07:05

Choose icon