# Когда терабайтов слишком много: от создания криминалистических образов к ИИ-анализу мультимедиа Владимир Грешнов и Сергей Савинков · ООО «ЭЛЕТЕК» MOSCOW FORENSICS DAY ’26 · День 1 — четверг, 3 сентября 2026 · По программе 12:30–13:00 · В записи 01:09:42–01:52:10 Саммари выступления · https://2026.moscow-forensics-day.workers.dev/summary/04-greshnov-savinkov Расшифровка: https://2026.moscow-forensics-day.workers.dev/transcript/04-greshnov-savinkov · Слайды: https://2026.moscow-forensics-day.workers.dev/slides/04-eletek-images-and-ai · Смотреть с 01:09:42: https://youtu.be/WuMIv5sFPRs?t=4182 --- ## Кратко Два доклада в одном. Грешнов показывает железо и софт для съёма: дубликатор, уходящий в серию в этом месяце, компактный копировщик для флешек, который второй год поставляется в МВД, блокираторы SATA и новый USB 3.0, плюс две программы на стадии финальных тестов — «горячее» снятие файлов по расширениям, путям и MIME-типам и работа с образами, включая подъём удалённых разделов. Савинков — про конвейер анализа разнородных данных: классификаторы текста, транскрибирование аудио с дообучением и своим словарём, разбор видео с поиском лиц и эмблем, описание происходящего на записи вместо её просмотра, единый портал поиска по всем типам. Самое живое — вопросы: зал давит на повторяемость результатов ИИ, прерывания при создании E01 и поиск замаскированных криптоконтейнеров, и по двум из трёх пунктов ответ «пока не работали» или «обратим внимание». ## Главное - ЭЛЕТЕК — интеграционные проекты и своя разработка: специализированные АПК и системы в защищённом исполнении, средства сбора и анализа данных, средства криминалистического и оперативного съёма, серверные системы под заказчика. В докладе две темы из этого списка. - **Дубликатор**: разрабатывали долго, в прошлом году показывали, «в этом месяце уходит в серию» и начинает поставляться. Задача — быстро и безопасно снять данные с исследуемых накопителей, и в лаборатории, и в поле: питание от 220 В или от PowerBank. - Источники — HDD, SSD, флеш; NVMe только через переходник на USB. Внутри полноценный микрокомпьютер: берут «мозги» готового модуля, а платы с нужными портами и встроенными аппаратными блокираторами разводят сами. - Копирование сквозное (на доверенный накопитель) либо во внутреннюю память — скоростной NVMe; сейчас ставят 2 ТБ, под заказ 4 ТБ. - **Компактный копировщик**: второй год поставляется в органы МВД. Только флеш-накопители — изначально просили оперативные службы: автономное устройство, которое «помещалось бы в кулак». Батарея 2000 мА·ч, около двух часов копирования с USB 3.0, с 2.0 дольше. - Хранилище — microSD: карту вынимают и через переходник подключают к компьютеру. Режимы: посекторный, файловый и по маскам; основной — файловый, «файлы нам скопировать все-таки быстрее в каких-либо оперативных условиях». - Мобильное приложение — «не столько для управления, сколько для преднастройки»: выбор режима, контроль статуса копирования и остатка памяти, работа с дампами и файловыми контейнерами. - **Блокираторы записи**: SATA выпускается давно (HDD 2,5" и 3,5" при дополнительном питании, SSD, всё на SATA); USB 3.0 — новинка, «еще в продаже не был», завершает финальные тесты: флеш напрямую, NVMe через переходник, но без максимальных скоростей NVMe. - **«Элемент-П»** — снятие данных «на горячую» с компьютеров под Windows и Linux: программа запускается с флешки, создаётся задание на копирование. Интереснее всего выборка: по расширениям, по путям и по MIME-типам — последнее ловит файл, у которого расширение убрали или подменили. - **Программа для работы с образами**: подключить посекторный образ, просмотр и сортировки файлов, подъём удалённой информации — удалённых файлов и разделов, с определением файловой системы каждого удалённого раздела, поиск по сигнатурам и MIME-типам. Обе программы на финальных тестах, демо «в ближайшее время». - **Вторая часть (Савинков)**: модульная система анализа — сборщики данных из интернета и служебных закрытых систем, обработчики, единый закрытый контур и многопользовательские порталы аналитиков с разграничением доступа. Данные делят на текст, аудио и графику. - **Текст**: 20 лет работы; классические классификаторы для точной классификации (тематики вроде физики или экстремизма, фактография — имена, компании, адреса, окрас и тип текста) применяются набором — последовательность даёт нужный результат. ИИ добавляет поиск постфактум по проиндексированному архиву. - **Аудио**: транскрибирование — «с одной стороны, уже решённая, с другой — всегда требующая индивидуального подхода» задача: шум, иностранные языки, много дикторов, переключение языков. Помогает дообучение и свой тематический словарь: на специализированной лексике штатные средства «притягивают транскрипцию к более популярному слову». - Дикторов только разделяют (диктор 1, диктор 2) — идентификацией «мы пока не занимались», это делают партнёры. Дальше перевод транскрипта, реферат по длинной записи или набору записей и вопросы к содержанию. - **Видео и изображения**: кадрирование и свой стек задач — классификация кадра (техника, люди, пейзажи, военные, документы), работа с лицами (поиск заданных или кластеризация всех), поиск эмблем, флагов, знаков, предметов; на выходе индексированный массив с метками, где что найдено. - Отдельный блок — распознавание документов, печатных и рукописных; у рукописных «качество чуть пониже». - Особенности аудиорешения: записи любой длины и стримы, стабильное потребление памяти («мы не пытаемся всю эту запись сразу забрать в память… как в некоторых решениях»), мультимодальность — куски смешанного диалога разводятся по распознавателям своего языка, адаптивность через словарь: на радиоперехватах геодезистов качество «повысится в разы просто из-за этого». - Масштаб — от ноутбука (один язык в момент времени, многоязычная запись обрабатывается дольше) до рабочей станции с параллельной многоязычностью и серверных конфигураций. - Ключевая идея для практики: не смотреть видео, а читать его описание. Реферат девятичасовой записи — «с первого по восьмой час у вас там деревья, ветер, забор и проезжает пять машин», а события начинаются с восьмого; из 24 часов уличной камеры остаются «три фрагмента по две минуты». Работает на заданных тематиках — хакерской, суицидах, драках. - Мотивировка объёмами: «200 гигабайт каких-то фотографий и файлов просмотреть уже невозможно» — даже данные с одного телефона глазами не просматривают. - Текстовый архив — «десятки терабайт» проиндексированных текстов с поиском за секунды и фильтрами по времени, типу файла и источнику. Классические алгоритмы сознательно работают параллельно с ИИ: на жёстко заданной рубрике они «и быстрее, и более качественно»; классификаторы делают под заказчика, с участием лингвистов. - Портал сводит все типы данных: сквозной поиск независимо от источника, свои рубрикаторы у каждого аналитика, подборки и отчёты (текущий, квартальный, годовой), представление карточками, текстом, картами и графами, донастройка под конкретное подразделение. ## Инструменты, артефакты, технологии - **Дубликатор** (серия с сентября 2026): HDD/SSD/флеш, NVMe через переходник, внутренний NVMe 2–4 ТБ, питание 220 В или PowerBank, встроенные аппаратные блокираторы. - **Компактный копировщик** (в МВД второй год): флеш, батарея 2000 мА·ч (~2 ч на USB 3.0), microSD как хранилище, режимы посекторный / файловый / по маскам. - **Блокираторы записи**: **SATA** (серийный) и **USB 3.0** (на финальных тестах; блокировка программная, внутри микрокомпьютер). - **«Элемент-П»** — «горячее» снятие с Windows и Linux по расширениям, путям, **MIME-типам**. - **Программа работы с образами** — посекторные образы, подъём удалённых файлов и разделов, определение ФС, поиск по сигнатурам и MIME; формат **E01**, ОС **Astra Linux**. - **Анализ данных**: классификаторы текста (тематические, фактографические, окрас, тип), транскрибирование с дообучением и тематическим словарём, разделение дикторов, перевод, реферирование, классификация кадров, поиск и кластеризация лиц, поиск эмблем и предметов, распознавание печатных и рукописных документов, описание происходящего на видео. - **Инфраструктура**: локальное развёртывание, двухзвенный контур (открытый и закрытый), от ноутбука до серверной группы, «две видеокарты» под модель, индексированный архив на десятки терабайт, многопользовательский портал. ## Правовой и организационный контекст Прямых ссылок на законы нет, но контекст ведомственный: компактный копировщик поставляется в органы МВД, системы делаются в защищённом исполнении и разворачиваются локально — «естественно, это не в облаке происходит». Ключевое требование, которое формулирует зал, — повторяемость результата ИИ как условие пригодности для экспертизы. Отдельно звучит тема импортозамещения: главное преимущество программы перед конкурентами — российское ПО и работа с E01 на Astra Linux. ## Вопросы из зала - **1** (имя не названо): нужен блокиратор, транслирующий параметры самого накопителя — интерфейс, серийный номер, SMART, — а не контроллера блокиратора. → В новом USB 3.0 это «реализовано частично и дальше реализовывается», в SATA-блокираторе нет. Там же: найдёт ли MIME-анализ криптоконтейнер, замаскированный под другой формат? → Да, есть готовые группы MIME-типов и пользовательская группа; но поиск всех зашифрованных объектов под видом обычных файлов — «в данном направлении пока что не работали», тему обещают поднять. - **2** (имя не названо): локальная модель или онлайн-сервис? Какие нужны характеристики стенда, какие модели и как решается вопрос контекста? → Только локально, возможен двухзвенный контур. Железо «от ноутбука до бесконечности» по задаче; поиск идёт по заранее проиндексированному архиву, у модели есть его схема; «как правило, это, например, две видеокарты, которые разворачивают 38 или 72 модель размера»; контекст запроса ограничен обычным образом, «но для анализа архива, который уже структурирован… вполне всего достаточно». - **3** (имя не названо): USB-блокиратор — микрокомпьютер или сигнальный процессор, блокировка программная? → Микрокомпьютер плюс своя плата; да, блокировка программная, внутри изделия. - **4** (имя не названо): чем программа лучше конкурентов, кроме того, что она российская? → Тем и лучше: российское ПО, работа на Astra Linux и работа с файлами E01 — «основная у нас была такая масштабная задача». - **5** (имя не названо, продолжает прошлый разговор): как с прерываниями при создании образа E01 — если диск отвалился, надо начинать заново, хотя на рынке есть продукты, умеющие продолжить. → Ответ: формат E01 «просто не поддерживает прерывания», потому что внутри идёт подсчёт контрольных сумм. Спрашивающий называет конкретные продукты (Belkasoft, Tableau) → «Мы обратим внимание, хорошо». - **6** (имя не названо): как оценивается эмоциональное состояние в аудио и какими словами описывается, например, драка? → По тембру, паузам, громкости; «какая-то научная работа проводилась, это уже есть стандартные решения». Про видео: тип драки система не разбирает, поэтому поиск строится не словом, а лингвистическим запросом — библиотекой запросов, «мини-классификатором», потому что в описании может не быть ни «удара», ни «драки». Настраивать должны лингвисты: «они лучше семантику понимают». Словарь терминов задаётся простым текстом — слово, Enter, слово. - **7** (имя не названо): как обеспечена повторяемость результатов ИИ — «это очень важно для экспертного исследования»? → Параметры заданы жёстко, повторяемость «будет очень высокой»; «фантазирование» полностью выключить нельзя, но оно сильно ограничено, иначе при транскрибировании получится произвольный текст; применяются предобработка, нарезка и свой набор моделей на каждый язык — «стек моделей». ## Позиция спикеров Грешнов говорит как инженер-производственник: что уже в серии, что ещё на тестах, где ограничения (NVMe только через переходник и без полной скорости, копировщик только для флешек). Савинков — как архитектор систем, и у него заметна осознанная сдержанность по ИИ: классические алгоритмы оставлены именно потому, что на жёстких рубриках работают лучше; идентификацию дикторов честно отдают партнёрам; «фантазирование» модели называется своим именем. Но там, где зал требует проверяемости — повторяемость, поиск шифрованного, прерывания E01, — ответы становятся общими, а два пункта прямо закрываются обещанием «посмотрим». ## Цитаты - «…сотрудники оперативных служб просили сделать максимально компактное автономное решение… буквально помещалось бы в кулак». - «С первого по восьмой час у вас там деревья, ветер. Забор и проезжает пять машин». - «…200 гигабайт каких-то фотографий и файлов просмотреть уже невозможно». - «Честно говоря, в данном направлении пока что не работали». - «Это как вот это придумывание, фантазирование нейронки… так нельзя его выключить, да? Но оно сильно ограничивается».