Результаты eval-харнеса humanizer-ru
July 18, 2026 · View on GitHub
Автогенерируемый отчёт (eval/run_eval.py). Детерминированные метрики считаются всегда; реальные детекторы и LLM-судья — опционально (см. футер).
Сводка
- AI-текстов в корпусе: 7, человеческих: 3
- Среднее по AI-текстам (raw): HARD BANS 13.0, маркеров 14.7, CV ритма 0.228
- Очеловеченных версий нет: показан только baseline (raw).
AI-тексты (вход скилла)
| id | тип | модель | HARD BANS | маркеры | CV | сущ/глаг | тире | вердикт |
|---|---|---|---|---|---|---|---|---|
marketing_gpt_01 | marketing | gpt | 14 | 15 | 0.184 | 1.95 | 2 | AI |
marketing_gemini_02 | marketing | gemini | 10 | 13 | 0.167 | 2.21 | 1 | AI |
expert_claude_03 | expert | claude | 10 | 11 | 0.328 | 3.27 | 1 | AI |
expert_gpt_04 | expert | gpt | 17 | 15 | 0.287 | 3.69 | 3 | AI |
business_claude_05 | business | claude | 13 | 20 | 0.147 | 2.72 | 1 | AI |
business_gemini_06 | business | gemini | 16 | 16 | 0.277 | 2.93 | 1 | AI |
docs_gpt_07 | docs | gpt | 11 | 13 | 0.204 | 2.94 | 1 | AI |
Контроль переусердствования (человеческие тексты)
Живой человеческий текст скилл НЕ должен хотеть сильно править. Тревога, если HARD BANS > 0 или маркеров > 5.
| id | тип | HARD BANS | маркеры | CV | сущ/глаг | тире | статус |
|---|---|---|---|---|---|---|---|
wiki_baikal | reference | 3 | 1 | 0.572 | 8.67 | 2 | ⚠ ложная тревога |
wiki_chaikovsky | reference | 3 | 0 | 0.129 | 10.25 | 3 | ⚠ ложная тревога |
wiki_programmirovanie | reference | 1 | 0 | 0.406 | 7.0 | 1 | ⚠ ложная тревога |
Итог контроля: 0/3 человеческих текстов прошли чисто.
Как это читать. Контроль — дословные отрывки статей Википедии (заведомо человеческий, но формальный регистр). Срабатывания здесь не баг, а та же ловушка, в которую попадают AI-детекторы (см. FP-аудит выше): формальный человеческий текст трудно отличить от машинного по поверхностным признакам. Конкретно тревогу дают (1) длинные тире «—» — Википедия использует их штатно, а скилл банит как маркер по строгой политике; (2) высокое сущ/глаг — это энциклопедический стиль, а не нейросеть. Вывод честный и в обе стороны: ни детектор, ни простые эвристики не выносят надёжный вердикт «человек/AI» на формальном тексте. Скилл поэтому и не детектирует, а переписывает — и нацелен на живой, а не на энциклопедический регистр.
Доступность инструментов в этом прогоне
- Локальная Ollama: жива (чат-модель
gemma3:4b, embednomic-embed-text) - Детекторы запрошены: нет; доступны: — (нет ключей/пакетов/Ollama)
- LLM-судья запрошен: нет; бэкенд: — (нет Ollama и нет ANTHROPIC_API_KEY)
- Очеловеченные версии: нет (baseline-режим)
Детерминированные метрики (HARD BANS, маркеры, CV ритма, сущ/глаг) считаются всегда и не зависят от ключей, Ollama или сети. LLM-слой (детекторы Ollama, судья, faithfulness) работает на ЛОКАЛЬНОЙ Ollama — ключ Anthropic не требуется.