Информационная архитектура «Матчасти»
Какие типы страниц существуют на mathchast.com, как связать компании, экспертов, темы, публикации и исследования в один knowledge graph, какие URL должны индексироваться, что не должно попадать в поиск, как строить canonical, breadcrumbs, topic hubs, sitemap и внутреннюю навигацию без взрыва миллионов тонких страниц.
1. Главное решение
2. Почему не строить всё внутри /blog/
Blog-first
/blog/category/article
Компания и эксперт становятся просто метаданными статьи. Позже трудно строить reputation, profiles, citations и data products.
Entity-first
/companies/company-name/experts/name/articles/slug
Каждая сущность имеет самостоятельную публичную жизнь и связи.
3. Базовая структура URL
| Тип | URL | Назначение | Индексировать? |
|---|---|---|---|
| Компания | /companies/{slug} | Verified business entity | При eligibility |
| Эксперт | /experts/{slug} | Публичный профиль человека | При eligibility |
| Статья | /articles/{slug} | Экспертный/редакционный материал | Да |
| Кейс | /cases/{slug} | Структурированный business case | Да |
| Исследование | /research/{slug} | Исследование / dataset story | Да |
| Новость | /news/{slug} | Новостной материал | Да |
| Тема | /topics/{slug} | Curated topic hub | Только approved hub |
| Отрасль | /industries/{slug} | Business vertical | После достаточной полноты |
| Поиск | /search?q=... | Внутренний search | Нет |
| Фильтры | ?topic=&industry=&sort= | UX-фильтрация | Нет по умолчанию |
4. Почему короткие URL лучше глубокой иерархии
Google рекомендует логичную и понятную человеку URL-структуру. Яндекс также рекомендует уникальные URL и понятную ссылочную структуру, при этом глубина вложенности влияет на скорость обнаружения страниц.
5. Slug policy
| Правило | Решение |
|---|---|
| Читаемый slug | Да |
| Транслитерация русских заголовков | Основной вариант для MVP |
| Кириллица в URL | Технически возможна, но усложняет копирование/аналитику; не основной вариант |
| Дата в URL | Не нужна для большинства типов |
| Company ID в публичном URL | Только при collision fallback |
| Slug меняется при новом заголовке | Нет после публикации |
| Очень длинный title → очень длинный slug | Сокращать до смыслового ядра |
6. Collision policy
Для юридических лиц могут совпадать бренды. В публичном UI обязательно показывать disambiguation: город, отрасль, официальный сайт или юридическое имя.
7. Главная страница
Главная «Матчасти» должна быть reader-first, а не витриной тарифов.
/for-business, но сам публичный домен должен доказывать наличие реального медиа.8. Раздел «Компании»
Company page не должна быть SEO-страницей, заполненной повторяющимися фразами. Основная ценность — структурированные данные и связи.
9. Index eligibility для компаний
| Состояние | Публичный URL | Index | Sitemap |
|---|---|---|---|
| Imported shell | Может существовать технически | noindex / не выдавать публично | Нет |
| Minimal reference entity | Да | По completeness threshold | Если indexable |
| Claimed | Да | Не автоматически | После eligibility |
| Verified + meaningful data | Да | Да | Да |
| Verified + publications/experts | Да | Высокий приоритет | Да |
Точный completeness threshold появится в Mathchast_19/20.
10. Эксперт
11. Статьи, кейсы, исследования и новости должны оставаться разными типами
| Тип | Почему отдельный |
|---|---|
| Article | Свободная экспертная/объясняющая структура |
| Case | Problem → process → result; отдельные structured fields |
| Research | Methodology, sample, dataset, findings, limitations |
| News | Event date, subject, source, factual update |
Позже это позволит создавать отдельные machine-readable представления и аналитические продукты.
12. Topics — важнее обычных тегов
Новый свободный тег автора не должен автоматически создавать /topics/random-keyword.
13. Topic hub как главный механизм Context Bridge
14. Topic states
| State | Публичность |
|---|---|
| PROPOSED | Только внутри CMS |
| INTERNAL | Используется для классификации, URL не индексируется |
| CURATED | Имеет редакционный hub |
| INDEXABLE | Полноценная публичная landing page |
| MERGED | 301 на каноническую тему |
| ARCHIVED | Историческая тема / redirect или archive по ситуации |
15. Industries
Industry — более стабильная business taxonomy, чем topic.
Не создавать сотни отраслевых pages до появления реальных компаний и контента.
16. Один объект — один canonical URL
Google и Яндекс оба рассматривают rel="canonical" как сигнал/рекомендацию при похожих и дублирующихся URL. Google дополнительно учитывает redirects, sitemap inclusion и другие сигналы.
17. Tracking parameters
| URL | Поведение |
|---|---|
/articles/x?utm_source=telegram | 200, canonical → clean URL |
?ref=company | Canonical → clean URL; лучше tracking event без альтернативной версии контента |
?sort=new на list | Не индексировать как отдельную страницу |
?topic=ai&industry=software | UX filter, не отдельный search landing по умолчанию |
18. Faceted navigation — потенциальный взрыв URL
Google отдельно называет faceted navigation одним из самых частых источников overcrawl: комбинации фильтров способны создать практически бесконечное URL-пространство и замедлить обнаружение полезных страниц.
19. Что делать с пустыми filter combinations
Если filter URL всё же crawlable и не имеет результатов, Google рекомендует возвращать настоящий 404 для бессмысленных комбинаций, а не генерировать бесконечные пустые страницы.
Но основной MVP-подход проще: filter state не является публичным indexable content object.
20. Internal search
21. Breadcrumbs
Google описывает breadcrumb как способ показать место страницы в иерархии и помочь пользователю перемещаться вверх по структуре.
| Страница | Breadcrumb |
|---|---|
| Article | Главная → Статьи → Материал |
| Case | Главная → Кейсы → Кейс |
| Research | Главная → Исследования → Исследование |
| Company | Главная → Компании → Компания |
| Topic | Главная → Темы → Тема |
Topic association не обязательно отражать в единственной breadcrumb hierarchy, потому что материал может иметь несколько тем. Темы отображаются отдельными ссылками.
22. Structured breadcrumb
BreadcrumbList для каждого основного публичного типа.23. Navigation depth
Яндекс рекомендует ясную ссылочную структуру и отмечает, что глубина вложенности влияет на скорость обнаружения страниц.
Не превращать архив в пагинацию на сотни экранов без альтернативных topic/entity links.
24. Связи внутри article page
25. Company → publication relation
Нужно различать роль компании в материале:
| Relation | Пример |
|---|---|
| AUTHOR_COMPANY | Компания предоставила partner article |
| SUBJECT | Материал о компании |
| CLIENT | Клиент в кейсе агентства |
| VENDOR | Исполнитель/поставщик в кейсе |
| MENTIONED | Просто упомянута |
| DATA_SOURCE | Источник данных |
| SPONSOR | Спонсор исследования |
Это важно и для публичного контекста, и для будущей AI Visibility аналитики.
26. Expert → publication relation
| Relation | UI |
|---|---|
| AUTHOR | Автор |
| INTERVIEWEE | Герой интервью |
| COMMENTATOR | Экспертный комментарий |
| RESEARCHER | Автор/участник исследования |
| MENTIONED | Упоминание |
27. Entity mentions внутри текста
Первое релевантное упоминание — хороший default. Остальные связи доступны через structured context blocks.
28. Home feed ≠ archive
Feed
Алгоритмически/редакционно выбранные свежие материалы. Может учитывать качество, свежесть, темы и reader interests.
Archive
Полный последовательный список соответствующего типа контента с pagination.
Платный boost не должен влиять на organic feed скрыто; promoted inventory маркируется отдельно.
29. Pagination
Яндекс прямо рекомендует обычные crawlable <a href> ссылки между документами. Google также исходит из crawlable URL discovery.
30. Sitemap architecture
Google ограничивает один sitemap 50 МБ в несжатом виде или 50 000 URL. При большем объёме используются несколько файлов и sitemap index.
31. Что попадает в sitemap
| URL | Sitemap? |
|---|---|
| Canonical published article | Да |
| Indexable verified company | Да |
| Draft | Нет |
| Noindex shell entity | Нет |
| Search result | Нет |
| Filter combination | Нет |
| Redirect URL | Нет |
| Removed URL | Нет |
32. lastmod
lastmod изменяем только при существенном обновлении содержания страницы, а не при каждом background job, счётчике просмотров или косметическом render.
33. Canonical consistency rule
34. Duplicate profiles
Одна из самых сложных будущих задач — company/entity duplicate resolution.
35. Brand ≠ legal entity
На публичной IA для MVP можно показывать одну понятную company page, но data model должен заранее различать:
Детально — в Mathchast_19.
36. Product/service pages
Product/Service entity можно хранить внутри graph, но индексируемые публичные product pages появятся только если у них появится самостоятельный reader use case.
37. Geography
Не создавать автоматически:
Город/регион — filter/data attribute. Публичный geographic hub появляется только при отдельной редакционной/справочной ценности.
38. Search landing pages
Правильный workflow:
39. Topic merge и synonyms
40. Multilingual architecture
На MVP основная аудитория русскоязычная. Не создавать автоматически английские копии всех страниц.
| Этап | Решение |
|---|---|
| MVP | RU only |
| Если появляется реальный EN demand | Отдельные переведённые canonical pages с явной language relation |
| Machine translation массово | Не индексировать автоматически без quality review |
41. /for-business
Это product marketing layer. Он не должен дублировать публичные статьи и company/entity pages.
42. /methodology и /policies
43. Источники и документы
Для research-heavy материалов позже может появиться Source entity, но не надо создавать публичную страницу для каждого URL автоматически.
44. Canonical vs redirect
| Ситуация | Инструмент |
|---|---|
| Страница реально переехала | 301/308 |
| Доступны tracking-параметры одной страницы | Self canonical на clean URL |
| Дубликат company profile после merge | 301 на canonical entity |
| Похожая, но самостоятельная статья | Не canonical на другую только ради SEO |
| Paginated archive | Каждая страница имеет свою URL-логику; не canonical всё на page 1 |
45. Index states как поле платформы
46. Robots и IA
Детально crawler policy будет в Mathchast_22, но IA уже определяет технические классы, которые не предназначены для поиска:
- admin;
- cabinet;
- checkout;
- draft preview;
- internal search;
- filter explosion;
- API private endpoints;
- temporary upload assets;
- experiments/preview routes.
47. Reader navigation
48. Entity pages должны иметь unique value
| Page | Минимальная уникальная value |
|---|---|
| Company | Verified structured facts + relations |
| Expert | Verified identity/expertise + publications |
| Topic | Definition + curated graph, не просто список ссылок |
| Industry | Meaningful directory/context, не пустая filter page |
| Article | Самостоятельный reader answer |
49. IA и commercial content
При этом фильтр «Партнёрские материалы» может существовать для прозрачности.
50. IA не должна скрывать рекламу
51. MVP navigation menu
Эксперты и новости существуют как типы страниц, но не обязаны занимать главное меню до появления достаточного объёма.
52. Footer
53. RSS
Публичный RSS логично заложить для редакционных материалов/типов, но не создавать отдельную индексируемую HTML-копию каждого feed. RSS станет дополнительным distribution interface.
54. API URLs
55. Technical SSR requirement
Яндекс рекомендует, чтобы важный индексируемый контент был доступен поисковому роботу в HTML, а не существовал только после клиентского JavaScript execution.
56. IA QA checklist перед запуском
57. MVP: что строим
| Раздел | MVP |
|---|---|
| /articles | Да |
| /cases | Да |
| /research | Да |
| /news | Да как тип; menu optional |
| /companies | Да |
| /experts | Да как pages; directory can be later |
| /topics | Да, curated |
| /industries | Data layer first, public hubs selectively |
| /products | Нет публичного массового каталога |
| /reviews | Позже |
| /ratings | Позже |
58. Решение документа
59. Что этот документ разблокирует
Источники исследования
- Google Search Central — URL Structure Best Practices
- Google Search Central — URL canonicalization: canonical signals, redirects and sitemap
- Google Search Central — Build and Submit a Sitemap: 50 000 URL / 50 MB limits and sitemap index
- Google Search Central — Breadcrumb / BreadcrumbList
- Google Crawling Infrastructure — faceted navigation and URL-space explosion
- Яндекс Вебмастер — структура сайта, обычные HTML-ссылки, вложенность, Sitemap и уникальные URL
- Яндекс Вебмастер — изменение структуры сайта, 301, Sitemap и HTML content availability
- Яндекс Вебмастер — canonical URLs
- Яндекс Вебмастер — Sitemap, robots и indexing recommendations
URL examples, entity types, index eligibility states, taxonomy states, navigation structure and MVP menu are product decisions «Матчасти». Search-engine-specific statements are based on current Google Search Central and Яндекс Вебмастер documentation and should be rechecked before production migrations.