---
name: diploma-antiplag
description: Проверка и подготовка диплома/ВКР к прохождению антиплагиата и ИИ-детектора (ИТМО и аналоги). Сканирует текст на признаки GPT-генерации по 10-пунктному чек-листу, выдаёт постраничный риск-репорт, переписывает помеченные куски с конкретикой и неровным ритмом. Опционально — autoresearch-петля против внешнего нейродетектора (метрика → переписать → замерить → оставить если упало → повторить). Использовать когда пользователь говорит "проверь диплом", "пройдёт ли антиплагиат", "ИИ-детектор", "нейродетектор", "вкр на оригинальность", "переделай чтоб не палилось как GPT", "антиплагиат ИТМО", "0% ИИ", или прикладывает .docx/.pdf диплома. НЕ про оформление текста (см. diploma-format) и НЕ про презентацию защиты (см. diploma-defense).
---

# Diploma Antiplag — текст ВКР под антиплагиат + ИИ-детектор

Скилл готовит ТЕКСТ работы к двум проверкам: оригинальность (антиплагиат) и доля ИИ-контента (нейродетектор). Только про проценты и переписывание — оформление и преза в отдельных скиллах.

**Калибрация (реальные данные):** первый прогон диплома на Антиплагиат.ИТМО (ifmo.antiplagiat.ru, май 2026) — ИИ-контент **25,52 %**, 20 красных страниц из 47. После переписывания по этому чек-листу + autoresearch-петли против нейродетектора Яндекса — доведено до **0 %**.

Полная памятка с разбором реального отчёта: `REFERENCE.md` в этой же папке (копия в `~/Documents/diploma-antiplag-guide.md`).

---

## Когда использовать

- Пользователь даёт текст ВКР/курсовой и хочет понять, попадёт ли под ИИ-детектор
- «Переписать чтобы не палилось как GPT», «довести ИИ до 0%»
- Спрашивает про антиплагиат ИТМО, eLIBRARY, «Кольцо вузов», нейродетектор
- Прикладывает PDF/DOCX работы

---

## Воркфлоу

### Шаг 1. Получить текст
- PDF — `pdftotext -layout file.pdf /tmp/text.txt`
- DOCX — `docx2txt` или python-docx
- Просто текст — работать напрямую

### Шаг 2. Постраничное сканирование на риск
Пройти по разделам от высокого риска к низкому:

**🔴 ВЫСОКИЙ (90 %+ помечаются):**
- Список сокращений / Глоссарий — каждое определение одинаково
- Введение — «прозовое», без чисел
- Анализ предметной области — общие рассуждения
- Выводы и заключение — шаблонные обороты

**🟡 СРЕДНИЙ:**
- Описание архитектуры — если без конкретики
- Обоснование выбора технологий — «X используется потому что…» в шаблоне

**🟢 НИЗКИЙ:**
- API-эндпоинты, схемы БД с конкретными полями
- Тестирование (числа, модели, версии)
- Список литературы
- Таблицы (в ИТМО ИСКЛЮЧЕНЫ из проверки — отдельный лайфхак)

### Шаг 3. Прогон по 10-пунктному чек-листу

Для каждого подозрительного параграфа считать галочки. **3+ галочки = переписывать.**

| # | Признак GPT | Маркер |
|---|---|---|
| 1 | 3+ коротких предложения подряд (7–12 слов) одной длины | «X. Y. Z.» — ровный пулемёт |
| 2 | Шаблон «X — это Y, который…» для каждого термина | весь глоссарий по копирке |
| 3 | Глаголы-пустышки: обеспечивает, позволяет, способствует, осуществляет, характеризуется | 2+ за абзац |
| 4 | Парные конструкции: «не только…, но и…», «как…, так и…», «с одной стороны… с другой» | 2+ за параграф |
| 5 | Связки-клише: «Таким образом», «В этой связи», «Следует отметить», «Особое внимание уделяется» | старт каждого 3-го абзаца |
| 6 | Перечисления из 3–4 синонимичных пунктов без конкретики | «гибкость, надёжность, масштабируемость и эффективность» |
| 7 | Абзацы одинаковой длины (4–6 строк) — текст «причёсанный» | визуально ровные блоки |
| 8 | Нулевая конкретика: ни цифр, ни имён, ни моделей, ни версий | абстрактная вода |
| 9 | Симметричный финал параграфа: «Это позволяет… что приводит к…» | концовки похожи |
| 10 | Идеальная вежливая нейтральность, ни «я заметил», ни «по практике», ни «как ни странно» | моноинтонация |

### Шаг 4. Выдать риск-репорт

```
🔴 ВЫСОКИЙ РИСК ИИ-ДЕТЕКТОРА (переписать):
- Раздел «Введение», абзац 2: галочки 1, 3, 5, 7 → 4/10
- Раздел «Список сокращений»: галочки 2, 7, 8 → 3/10 (вся секция)

🟡 СРЕДНИЙ РИСК:
- Раздел 3.1 «Выбор технологий»: галочки 3, 9 → 2/10

🟢 ОК:
- Раздел 3.10.3 «Тестирование нагрузки» — конкретика спасает
- Список литературы — стандартно
```

### Шаг 5. Переписать рискованные куски — 8 техник

1. **Ломать ритм.** Чередовать короткие (4–6 слов) и длинные (25–35 слов) предложения. GPT не делает резких перепадов.
2. **Плотно вставлять конкретику.** Не «обеспечивает быстрый отклик», а «470 мс при 100 пользователях через Apache JMeter». Числа, версии, имена тулов, модели.
3. **Личное наблюдение.** «Практика проведения турниров показывает…», «при отладке выяснилось…». GPT избегает таких зачинов в академическом регистре.
4. **Оставлять шероховатости.** Лёгкая корявость снижает «слишком гладко» = главный маркер GPT.
5. **Прятать прозу в таблицы.** В ИТМО таблицы исключены из проверки. 5 абзацев требований → 8-строчная таблица.
6. **Заменять шаблон определений.** «React — это библиотека JavaScript…» → «React используется как клиентская часть, потому что компонентная модель уже была знакома команде по предыдущим проектам».
7. **НЕ работает: перефразирование синонимами.** Модуль «Перефразированные заимствования» ловит. Менять надо структуру предложения, не отдельные слова.
8. **НЕ работает: перевод с английского.** Модуль «Переводные заимствования IEEE/PubMed/Интернет» ловит перевод чужих пейперов через DeepL/Google.

---

## Autoresearch-петля против нейродетектора (как довели до 0 %)

Если есть доступ к внешнему ИИ-детектору (в кейсе автора — нейродетектор Яндекса) — превратить переписывание из «на ощущениях» в **измеримую оптимизацию**. Это применение общего скилла `autoresearch` к метрике «% ИИ».

**Петля:**
1. **Метрика** = % ИИ на нейродетекторе. Это objective function (направление — вниз).
2. **Baseline** — прогнать исходный текст, зафиксировать стартовый %.
3. **Итерация** — взять самый красный раздел → переписать по технике из Шага 5 → прогнать через детектор → **оставить правку, если % упал; откатить, если вырос или без изменений**.
4. **Лог** — какие техники на каких разделах сработали (рваный ритм почти всегда даёт, синонимы — почти никогда).
5. **Повторять**, пока не достигнут целевой порог (у ИТМО ≤ 10 %; в кейсе доведено до 0 %).

**Что реально двигает иглу** (по логу реальных итераций):
- ✅ Рваный ритм (короткое + длинное вперемешку) — сильнее всего.
- ✅ Плотная конкретика (числа, версии, имена тулов).
- ✅ Личные зачины («при отладке выяснилось»).
- ✅ Проза → таблицы (в ИТМО вне проверки).
- ❌ Синонимы — ловит модуль перефразирования.
- ❌ Перевод EN↔RU — отдельный модуль.

**Дисциплина петли:** одна правка за итерацию (иначе не видно, что сработало); метрика — король (упало → keep, не упало → откат); не крутить одну и ту же неработающую технику.

---

## Контекст системы Антиплагиат.ИТМО (актуально на май 2026)

47 модулей проверки. Ключевые:
- **Кольцо вузов** + «переводы и перефразирования» — дипломы других вузов
- **Собственная коллекция компании** — свой вуз, прошлые курсы → копировать у однокурсников бесполезно
- **Перефразированные заимствования** — синонимы и перестановки
- **Переводные заимствования** — англ↔рус
- **Шаблонные фразы** — клише академического стиля
- eLIBRARY, РГБ, Патенты СНГ, PubMed, IEEE, ГАРАНТ
- Профессиональная лексика: Медицина, Юриспруденция, АПК

**Параметры проверки в ИТМО:**
- ✅ «С учётом редактирования» — ловит невидимые символы, омоглифы → НЕ вставлять такие
- ❌ OCR — Нет
- ❗ Таблицы исключены из проверки (зона безопасности)

**Пороги:**
- Оригинальность ≥ 70 % (обычно)
- ИИ-контент: официальный порог ИТМО **≤ 10 %** (в 2025-2026 жёстко). Для контекста: 25,52 % диплом ещё прошёл в мае 2026, но это риск — целиться сильно ниже.
- Совпадения <0,5 % система исключает автоматически

---

## Жёсткие запреты для пользователя

- ❌ Юникод-невидимки между букв — «с учётом редактирования» ловит
- ❌ Омоглифы (русская «а» на латинскую `a`) — ловит
- ❌ Перевод английских статей через DeepL — отдельный модуль
- ❌ Копирование у однокурсников / прошлых курсов — «Собственная коллекция компании»
- ❌ Просить GPT «переписать менее формально» — он сохраняет ритм. Только руками по чек-листу (или через autoresearch-петлю).

---

## Стиль вывода

- Конкретные цитаты из текста пользователя в риск-репорте
- Каждой проблеме — номер пункта чек-листа
- Переписанный вариант рядом с исходным (before/after)
- Не вычищать до идеала — оставлять живые шероховатости
- Не переходить в режим «отполируй» — задача обратная

---

## Связь с другими скиллами

- **`diploma-format`** — оформление текста ВКР (заголовки, нумерация, дефисы, БД в приложении).
- **`diploma-defense`** — презентация и защита перед ГЭК.
- **`autoresearch`** — общий движок петли оптимизации (используется в секции про нейродетектор выше).
- **`humanizer-ru` / `ru-text`** — общий редактор русского текста. Здесь акцент именно на обходе ИИ-детектора, а не на стиле в целом.
- Если работа на оригинальность 0 % (полностью свой текст) — это другая задача, не этот скилл.
