Результаты eval-харнеса humanizer-ru

July 18, 2026 · View on GitHub

Автогенерируемый отчёт (eval/run_eval.py). Детерминированные метрики считаются всегда; реальные детекторы и LLM-судья — опционально (см. футер).

Сводка

  • AI-текстов в корпусе: 7, человеческих: 3
  • Среднее по AI-текстам (raw): HARD BANS 13.0, маркеров 14.7, CV ритма 0.228
  • Очеловеченных версий нет: показан только baseline (raw).

AI-тексты (вход скилла)

idтипмодельHARD BANSмаркерыCVсущ/глагтиревердикт
marketing_gpt_01marketinggpt14150.1841.952AI
marketing_gemini_02marketinggemini10130.1672.211AI
expert_claude_03expertclaude10110.3283.271AI
expert_gpt_04expertgpt17150.2873.693AI
business_claude_05businessclaude13200.1472.721AI
business_gemini_06businessgemini16160.2772.931AI
docs_gpt_07docsgpt11130.2042.941AI

Контроль переусердствования (человеческие тексты)

Живой человеческий текст скилл НЕ должен хотеть сильно править. Тревога, если HARD BANS > 0 или маркеров > 5.

idтипHARD BANSмаркерыCVсущ/глагтирестатус
wiki_baikalreference310.5728.672⚠ ложная тревога
wiki_chaikovskyreference300.12910.253⚠ ложная тревога
wiki_programmirovaniereference100.4067.01⚠ ложная тревога

Итог контроля: 0/3 человеческих текстов прошли чисто.

Как это читать. Контроль — дословные отрывки статей Википедии (заведомо человеческий, но формальный регистр). Срабатывания здесь не баг, а та же ловушка, в которую попадают AI-детекторы (см. FP-аудит выше): формальный человеческий текст трудно отличить от машинного по поверхностным признакам. Конкретно тревогу дают (1) длинные тире «—» — Википедия использует их штатно, а скилл банит как маркер по строгой политике; (2) высокое сущ/глаг — это энциклопедический стиль, а не нейросеть. Вывод честный и в обе стороны: ни детектор, ни простые эвристики не выносят надёжный вердикт «человек/AI» на формальном тексте. Скилл поэтому и не детектирует, а переписывает — и нацелен на живой, а не на энциклопедический регистр.


Доступность инструментов в этом прогоне

  • Локальная Ollama: жива (чат-модель gemma3:4b, embed nomic-embed-text)
  • Детекторы запрошены: нет; доступны: — (нет ключей/пакетов/Ollama)
  • LLM-судья запрошен: нет; бэкенд: — (нет Ollama и нет ANTHROPIC_API_KEY)
  • Очеловеченные версии: нет (baseline-режим)

Детерминированные метрики (HARD BANS, маркеры, CV ритма, сущ/глаг) считаются всегда и не зависят от ключей, Ollama или сети. LLM-слой (детекторы Ollama, судья, faithfulness) работает на ЛОКАЛЬНОЙ Ollama — ключ Anthropic не требуется.