Купить только этот отчёт
Разовая оплата откроет полную версию этой проверки. Без покупки тарифа.
Купить этот отчётЭтот текст — для редактора, который готовит техническое задание (ТЗ) для копирайтера. Вы уже знаете, что страница конкурента ранжируется выше, но не понимаете, за счёт какого контента. Ваша задача — не просто скопировать текст, а понять, из каких блоков он состоит, какой у него объём и какую смысловую нагрузку несёт каждый раздел. Материал объяснит, как извлечь чистый текст из HTML-кода страниц конкурентов, чтобы на основе этого анализа составить каркас ТЗ для новой страницы вашего сайта.
Прежде чем приступать к сбору данных, нужно убедиться, что проблема именно в контенте, а не в технических факторах. Вот несколько маркеров, указывающих на недостаточную релевантность страницы:
Если вы заметили хотя бы два из этих признаков, пора переходить к анализу контента конкурентов.
Процесс извлечения чистого текста состоит из нескольких этапов. Важно понимать, что вы работаете не с визуальным представлением страницы, а с её исходным кодом.
1. Сбор URL конкурентов. Определите 3-5 страниц, которые ранжируются по вашему целевому запросу. Это могут быть как прямые конкуренты, так и сайты из смежных ниш, но с похожей структурой контента.
2. Загрузка HTML-документов. Сохраните исходный код каждой страницы. Используйте браузерные инструменты разработчика (Ctrl+U или правая кнопка мыши — «Просмотр кода страницы»). На этом этапе вы сталкиваетесь с первым ограничением: динамический контент, который подгружается через JavaScript, может не попасть в сохранённый HTML. Для таких страниц потребуется более сложный парсинг.
3. Очистка от тегов и удаление лишних блоков. Из сырого HTML нужно удалить навигацию, рекламные вставки, футер, боковые колонки и другие элементы, не относящиеся к основному контенту. Это ручной или автоматизированный процесс, который включает:
<script>, <style>, <nav>, <footer>;.article-content, #main-text).На этом этапе полезно использовать инструмент очистки HTML, который автоматически удаляет лишние теги и оставляет только чистый текст. Это экономит время и снижает риск ошибки при ручной чистке.
После того как вы получили чистый текст каждого конкурента, начинается самый важный этап — анализ. Ваша цель — выявить закономерности в структуре контента.
Ключевые блоки, которые нужно зафиксировать:
Пример анализа: | Конкурент | Заголовок H2 | Тип блока | Объём (символов) | |-----------|--------------|-----------|------------------| | Сайт А | «Как выбрать материал» | Маркированный список | 1200 | | Сайт Б | «Критерии выбора» | Таблица + абзац | 1800 | | Сайт В | «На что обратить внимание» | Сплошной текст | 900 |
Из этой таблицы видно, что оптимальная структура — комбинация таблицы и поясняющего текста, а средний объём раздела — около 1500 символов.
Процесс извлечения чистого текста не идеален. Важно учитывать возможные проблемы, чтобы не получить искажённые данные.
Основные риски:
Когда у вас есть чистый текст конкурентов, структурированный по блокам, и таблица с объёмами, можно приступать к созданию ТЗ.
Каркас ТЗ должен включать:
Такой подход снижает количество правок, потому что копирайтер получает чёткие ориентиры, а не абстрактное «напишите качественный текст». Проверить, насколько собранный чистый текст соответствует вашим ожиданиям, можно в инструменте очистки HTML — он покажет, какие блоки были потеряны при парсинге и насколько равномерно распределён объём.
После завершения анализа у вас будет:
Этот результат позволяет не гадать, какой контент нужен пользователю, а опираться на проверенные данные. Вы не копируете конкурентов, а адаптируете их успешные решения под свою страницу, избегая типичных ошибок и дублей.