Источники данных

Автоматический pipeline: сайты компаний, контакты и соцсети со страниц, ЕГРЮЛ, AI-описание и векторизация. База: 2.4 млн организаций, ~80% с контактами, 89 регионов.

Pipeline

От сайта до вектора

Сайты

DNS, HTTP и страницы компаний. С них снимаются контакты, мессенджеры и ссылки на соцсети.

ЕГРЮЛ и открытые источники

Юридический контур дополняет карточку. Это не замена смыслу с сайта: реестр часто слишком общий.

AI и векторы

Описание, ключевые слова, локация, отрасль. Затем эмбеддинг — чтобы работал векторный поиск.

Цифры

Покрытие

  • 2 400 000+ компаний и организаций.
  • ~80% записей с контактными данными.
  • 89 регионов России.
  • 8 млн+ сайтов рунета в собственном индексе.
  • 560 000+ групп и каналов ВКонтакте, 450 000+ Telegram-каналов.
  • 40 млрд+ токенов потрачено на классификацию и обогащение карточек.
Контекст

Почему раньше такой базы не было

В ЕГРЮЛ ~2,9 млн действующих юрлиц, но сайты есть только у ~600 тысяч. В 2ГИС без дублей филиалов — около миллиона компаний. Получается, что для точного поиска было недоступно 80–90% рынка: данные разрознены и быстро устаревают.

ИП — слепая зона рынка

В ЕГРИП ~5 млн действующих ИП, и ни у одного справочника нет по ним контактных данных. Поиск по открытым данным — сайтам, соцсетям, картам — позволяет до них дотянуться.

Свой индекс, свои сервера

Мы индексируем рунет как поисковик и превращаем сайты в структурированные карточки. Поверх Google или Яндекса такое не построить — там ограничение на выдачу.

Смысл вместо классификатора

Каждая карточка проходит классификацию и обогащение: описание, услуги, ключевые слова, сектор, вектор. Поиск идёт по реальной деятельности, а не по коду ОКВЭД.

Только открытые источники

Все данные — из публичных источников: сайты компаний, реестры, открытые документы. Соответствие 152-ФЗ, данные и серверы — в РФ.

Данные

Что внутри карточки компании

Каждая карточка — это не строка из реестра, а обогащённый AI профиль, собранный из открытых источников.

Контакты и каналы

Email, телефон, Telegram, ВКонтакте, WhatsApp, Instagram, YouTube. Каналы видны до выгрузки — можно срезать сегмент только по тем, у кого есть нужный канал.

AI-обогащение

Описание деятельности, услуги, ключевые слова и сектор генерируются моделью по сайту компании — поэтому поиск работает по реальному профилю, а не по коду ОКВЭД.

30+ полей фильтров

Город, регион, домен, соцсети, контакты — любое поле карточки участвует в SQL-фильтрах поверх смыслового поиска.

FAQ

Вопросы: Источники данных

Коротко о главном

Собственный индекс рунета: 8 млн+ сайтов компаний и организаций. Плюс открытые источники и реестры. Каждая карточка обогащается AI: описание деятельности, услуги, ключевые слова, сектор, контакты и ссылки на соцсети.

Продукт

Другие возможности

Векторный поиск

Строка сравнивает запрос с эмбеддингами 2.4 млн компаний РФ. «Молочные заводы» находит комбинаты, даже если этих слов нет в названии.

Полнотекстовый поиск

Слой по словам: название, домен, описание и ключевые слова. Нужен, когда важны конкретные формулировки, бренд или домен — не только смысл ниши.

Агент

Чат по 2.4 млн компаний РФ: сегменты, фильтры, выгрузка. Это не общий Claude или ChatGPT — у агента есть база Строки, а не только публичный интернет.

API

REST API для CRM, скриптов и внутренних дашбордов. Поиск, SQL-фильтры, выгрузка контактов. Документация — docs.strokka.com, базовый URL — app.strokka.com/api/v1.

Фильтры и соцсети

Больше 30 полей: город, регион, email, телефон, Telegram, ВКонтакте, WhatsApp и другие каналы. Можно комбинировать с текстовым поиском.

Экспорт контактов

Просмотр выдачи бесплатный, контакты часто маскируются. Полные email и телефоны — выгрузка по кредитам или API-ключу: 1 кредит = 1 компания.

Связаться

Есть вопросы? Мы поможем!

Соберем базу по вашим запросам и параметрам. Оставьте заявку — и мы с вами свяжемся.