Подводка ведущего

А мы возвращаемся на вторую часть нашего сегодняшнего мероприятия. Пока все гости собираются в зале, немножко расскажу, о чем будет наш следующий доклад. Раньше главной задачей было получить как можно больше данных из различных цифровых источников. Но когда перед тобой уже будет несколько терабайт различных фотографий, видеозаписей и других данных бесчисленных, которые хранят нынешние устройства, причем абсолютно любые, даже в том числе уже и мобильные, то это встает большой вопрос: а как найти что-то важное, и как со всем этим дальше работать? И здесь без автоматизации уже довольно будет сложно обойтись. О том, как перейти от создания криминалистических образов к ИИ-анализу мультимедиа, расскажут наши коллеги и партнеры конференции, представители компании ЭЛЕТЕК, Владимир Грешнов и Сергей Савинков.

Ребята, вам слово. Встречайте аплодисментами.

Вступление: чем занимается ЭЛЕТЕК

Добрый день. Сейчас, наверное, еще минуту подождем, когда все усядутся.

— Так, сейчас небольшое вступительное слово. Наша компания занимается как интеграционными проектами, так и разработкой собственных программных и девайс-средств. Наши, скажем так, основные направления, то есть мы делаем специализированные системы, АПК, системы в защищённом исполнении, программные средства сбора и анализа данных, средства съема данных криминалистических, оперативных и так далее, ну и, соответственно, какие-то системы, большие серверные, интеграционные под заказчика.

Сегодня наш рассказ будет посвящен двум тематикам из представленных. Это средства криминалистического съема данных и средства анализа разнородных данных. Для первой части я передам слово коллеге Владимиру, на вторую вернусь.

Владимир Грешнов: дубликатор и компактный копировщик

— Да, ну что ж, всех приветствую. Как уже сказал Сергей, сегодня мы на данном мероприятии представлены двумя подразделениями нашей компании. Я вам расскажу как раз об оборудовании и о программном обеспечении, которое необходимо нам для съема данных и для работы с образами данных.

Первый комплекс, мы его разрабатывали достаточно долго, наверное. В прошлом году он у нас уже был первоначально представлен. Но вот в этом году, точнее вот в этом месяце, он уже у нас уходит в серию и уже начинает поставляться. Данный комплекс у нас является дупликатором. Дубликатором, который позволяет нам быстро и, что самое главное, безопасно снять данные с исследуемых накопителей.

Требуется он нам как в лабораторных условиях, то есть можно работать с накопителями, которые были изъяты, либо в полевых условиях, допустим, на каких-либо выездах. Работает данный комплекс у нас, питается от сети 220. Также при необходимости его можно запитать от PowerBank. То есть это тоже имеет место быть, чтобы, допустим, в полевых условиях можно было спокойно его запитать и работать с ним. Основное его предназначение — это копирование именно с внешних накопителей данных, таких как HDD, SSD диски и с флеш-накопителей.

Также есть возможность копировать NVMe-накопители через переходник NVMe на USB. Внутри у нас располагается полноценный микрокомпьютер. Сейчас мы очень активно стали работать с модульными решениями. То есть мы берем определенного типа, грубо говоря, мозги от микрокомпьютера. Дальше мы уже своими силами разводим платы уже с необходимыми нам портами, встроенными аппаратными блокираторами и так далее. И непосредственно их соединяем, получается такое уже полноценное устройство.

По копированию. Он может копировать как на сквозную, то есть с исследуемых накопителей на какие-либо ваши доверенные, так и на внутреннюю память. Внутренней памятью у нас является диск NVMe скоростной. По объему сейчас мы больше поставляем двухтерабайтные диски, но по желаниям заказчиков мы можем дополнить и диски по 4 терабайта. Здесь в этом проблемы никакой нет, благо сейчас это все производится и активно продается.

Следующее наше изделие — это у нас самый компактный наш копировщик. В принципе, про него уже многие достаточно много слышали, кто-то, может быть, с ним работал, так как данное изделие у нас поставляется в органы МВД, это самое основное, уже где-то второй год.

Данный копировщик позволяет скопировать данные именно с флеш-накопителей. Почему здесь у нас идет ограничение флеш-накопителей? Изначально он разрабатывался как оперативное решение, то есть сотрудники оперативных служб просили сделать максимально компактное автономное решение, которое можно было бы брать с собой, и оно буквально помещалось бы в кулак, помещалось в кармане. Как уже ранее сказал, он автономный, то есть питается он от внутренней батареи на 2000 мА·ч.

При копировании на 2 часа, если делать съем именно с накопителей, которые поддерживают интерфейс 3.0. Если накопители 2.0, соответственно, он проработает дольше.

В нем внутри также у нас встроен полноценный микрокомпьютер, который позволяет работать ему. В качестве хранилища здесь мы используем microSD-карту, то есть после копирования можно спокойно эту карту извлечь. Здесь, к сожалению, на фотографии не представлен второй бокс. Бокс данного изделия, где как раз базируется данная карточка. Карточка извлекается, через переходник подключается к компьютеру, и, пожалуйста, можно работать уже со скопированными данными.

По режимам копирования он поддерживает у нас как посекторное, файловое копирование, копирование по маскам, но основное все-таки он подразумевался для копирования именно файлов. Так как файлы нам скопировать все-таки быстрее в каких-либо оперативных условиях. Секторное копирование мы тоже оставили, то есть все-таки дупликатор должен уметь делать посекторную копию. На следующем слайде вы можете видеть как раз приложение для управления и первым, и вторым комплексом, но даже здесь оговорюсь, не столько для управления, сколько для преднастройки.

На втором скриншоте вы можете видеть, что для комплекса выбирается изначально режим работы, то есть в каком он будет производить копирование. Посекторное, файловое либо по маскам. На первом скриншоте, это наш первый экран, производится отслеживание режима, то есть отслеживание самого копирования, что происходит, в каком статусе, сколько памяти осталось на внутреннем хранилище. И последний, третий скриншот, здесь уже мы работаем непосредственно с самими дампами либо файловыми контейнерами, которые были скопированы. Их возможно как выгрузить. Выгрузить на мобильное устройство, на котором базируется приложение. Ну, соответственно, так и работать с этими данными непосредственно с накопителями, на которые они были скопированы.

Блокираторы SATA и USB 3.0, программные комплексы

Следующее изделие, которое мы производим, это даже блок изделий. Это у нас блокираторы записи. Ну, в принципе, устройства всем максимально знакомые, устройства сами по себе такие простые. То есть здесь это представлен блокиратор SATA. Он нами выпускается уже... далеко не первый год.

По устройству он максимально прост. Пожалуйста, он может работать с дисками HDD 2,5, 3,5 дюйма при подкидывании дополнительного питания. С дисками SSD, в принципе, со всеми устройствами, которые поддерживают интерфейс SATA.

И второй блокиратор, это наше новое решение. Это блокиратор USB 3.0. То есть он у нас еще... еще в продаже не был. То есть он пока что только завершает, так сказать, свои финальные тесты. В принципе, тоже устройство достаточно простое. Подключается питание, запитывается. Подключается через второй порт к компьютеру. И через порт USB Type-A, пожалуйста, подкидывается любое флеш-устройство. Также при необходимости можно подкинуть и NVMe-накопитель через переходник. Но здесь уже, к сожалению... пока что мы скоростей максимальных NVMe не поддерживаем на данном устройстве. Все-таки больше мы его для флеш-накопителей подразумевали.

Следующий блок изделий, который мы выпускаем, здесь это уже не аппаратно-программные комплексы, это именно наши программные решения. Первое решение, это у нас такой комплекс, как «Элемент-П». Он позволяет нам на горячую снимать данные с компьютеров с файловыми системами Windows, Windows и Linux. То есть, каким образом он работает? У нас на накопителе либо на флешке находится данная программа. Пожалуйста, мы подключаем ее к компьютеру. Программа запускается, вы создаете задание в ней на необходимые типы копирования. Допустим, вы хотите снять абсолютно все файлы с файловой системы. Пожалуйста, создаете задание, запускаете, и все файлы просто летят к вам на ваше устройство.

Но здесь все-таки, чем она интересна, это тем, что вы можете снимать не все файлы, а искать какие-либо определенные файлы по расширениям, файлы по путям, либо файлы по MIME-типам. То есть с MIME-типами мы не так давно начали в наших дупликаторах работать. Пожалуйста, можно будет определить, если злоумышленник убрал расширение у нужного вам файла, либо его поставил другое. То есть программа поймет, что данный документ... является, допустим, не аудиофайлом, а текстовым файлом. И программа его снимет.

На данном слайде представлены как раз скриншоты интерфейса. То есть как это приблизительно выглядит и работает.

И следующий наш программный комплекс — это программа для работы уже непосредственно с образами данных. То есть предыдущими решениями вы можете сделать посекторный образ. А данной программой вы можете этот образ как раз... подкинуть. Посмотреть, какие внутри есть файлы. Применить различные сортировки этих файлов по расширениям, по дате модификации, создания и так далее. И также данная программа как раз поддерживает подъем удаленной информации. То есть вы можете провести сканирование на предмет каких-либо удаленных файлов либо удаленных разделов.

Также программа вам сможет показать, что в таком-то разделе применялась такая-то файловая система, в удаленном, в таком-то разделе такая файловая система. Ну и, соответственно, попытаться восстановить как можно больше данных, которые были удалены. Также она умеет работать с сигнатурами. То есть, умеет осуществлять поиск по сигнатурам. И поиск, соответственно, по MIME-типам. Ну, на данном скриншоте можете видеть именно сами скриншоты программы.

Ну вот данная программа и предыдущая программа для копирования, они сейчас уже находятся на стадии финальных тестов. То есть, в принципе, в ближайшее время можно будет получить демо-версии для того, чтобы их апробировать, соответственно, на вашей базе. Ну что ж, данный блок, про который я рассказывал, завершен. Я передаю слово своему коллеге.

Сергей Савинков: анализ разнородных данных — текст, аудио, видео

Дальше будет рассказ уже про анализ разнородных данных.

Расскажу про набор программных наших продуктов, которые мы также интегрируем в комплексы под заказчика. Он имеет такую модульную систему. То есть, есть ряд обработчиков, есть ряд съемников информации в плане сбора данных с каких-то порталов интернета или служебных. Это может быть там какие-то закрытые системы служебные, развернутые у вас. Данные могут соединяться как раз из интернета и из служебных, попадать в условно закрытый контур и там анализироваться и предоставлять средства.

Уже многопользовательской работы аналитиков. То есть, это порталы многопользовательские с разграничениями доступа различными, где уже непосредственно аналитики или другие работники ищут информацию, систематизируют ее, составляют отчеты. Ну, сегодня рассказ больше от центрального блока коснется именно обработки данных. Если интересно, про остальные можем рассказать на стенде. Значит, различные виды данных, условно, мы их так разделили на текст, аудио и графические данные.

С текстом мы работаем уже лет 20. Сейчас мы используем как классические алгоритмы для такой точной классификации. То есть, когда у вас заранее известно, что вы хотите искать. Это могут быть как такие абстрактные тематики. Например, тексты, касаемые физики, экстремизма. Все, что угодно. Так и могут быть более специализированные классификаторы. То есть, найди мне именно фактографические какие-то упоминания в тексте, имена, названия компаний, адреса, оцени окрас, тип текста, то есть, научная литература, свободные высказывания, СМИ и так далее.

Как правило, классификаторы применяются в наборе. То есть формируется специальная последовательность классификаторов, которые на выходе дают нужный аналитический результат. То есть, найди мне такую-то тему, при этом, чтобы упоминался, например, такой регион или такая страна, и был там негативный окрас, например, или был научно-публицистический окрас. Также сейчас для анализа текста активно применяются средства ИИ. Они уже позволяют вам как постфактум искать, то есть, вы сначала индексируете свои наборы текстовых данных большого объема, извлеченные из различных источников. Еще раз повторю, это может быть единый архив данных, извлеченных из телефона, из флеш-накопителей, из компьютеров, так и добавлены туда данные из открытых источников, сайтов интернет.

И вы в них уже ищете по заданию, например, то есть, выявив все участки текста, в которых упоминается такая-то и такая-то семантика с необходимым окрасом или поведением, поведенческим типом. Аудиоданные, что здесь добавляется? Собственно говоря, добавляется транскрибирование звука, задача такая, с одной стороны, в современности уже и решенной, но и с другой стороны, всегда требующей индивидуального подхода. То есть, аудиоданные, полученные шумами на иностранных языках, где много дикторов говорит, где переключение между языками есть всегда, требуют дополнительной настройки, дообучения. У нас вот есть решение. Вы можете данные дообучить, можете подложить ему свой тематический словарь.

То есть, когда идет специализированная лексика, штатные средства транскрибирования хуже справляются. Они пытаются притянуть транскрипцию к более популярному слову. А у вас, может быть, идет какой-то жаргон или специализированная лексика. Соответственно, далее определяются дикторы. Мы пока занимаемся только разделением дикторов. То есть, диктор 1, диктор 2. Идентификацией дикторов некоторые наши партнеры занимаются. Мы пока не занимались этим направлением. Затем, соответственно, транскрибированный текст может быть переведен с иностранных языков и получен реферат. То есть, если у вас запись длинная или у вас набор записей, можно получить единый реферат, о чем шла речь.

Либо уже конкретно спросить, например, были ли там какие-то факты в этом разговоре или нет. Графические данные. К первым двум видам добавляется еще картинка. Собственно говоря, это видео или картинки на вход. Если это видео, то идет кадрирование и выполняется свой стек задач. Собственно говоря, это работа с кадром целиком. Тут идет классификация, что за кадр, техника, люди, пейзажи, военные, документы и так далее.

Отдельно работают с лицами. То есть, поиск заданных лиц либо кластеризация просто всех лиц, представленных на этом видео или изображениях. Специализированный поиск заданных эмблем, флагов, знаков, каких-то предметов и так далее. То есть, задается семантика и идет распределение, выделение кадров, где присутствует эта семантика. Соответственно, на выходе получается большой массив индексированных видеоданных, в котором проставлены точки, где есть искомые объекты, лица, опять-таки же, тексты, изображения.

И отдельно мы довольно глубоко работали с распознаванием различных документов. То есть, это могут быть как документы печатные, так и рукописные. Соответственно, у рукописных качество чуть пониже. Но печатные документы тоже в очень разном формате могут быть. То есть, сейчас примеры покажу. Значит, поподробнее про аудиозаписи. Особенности наших решений. Мы можем обрабатывать записи любой длины. Стримовые записи.

Идет стабильное потребление памяти. То есть, мы не пытаемся всю эту запись сразу забрать в память и так далее, как в некоторых решениях. Мультимодальность. Имеется в виду, что у вас может быть смешанная запись диалогов нескольких людей, которые говорят на разных языках, одновременно говорят. Процессор выделяет отдельные кусочки и, соответственно, по определенному языку направляет их на соответствующий распознаватель, транскрибирователь текста.

Адаптивность. Это я упомянул, что возможно задавать свой специализированный словарь, направление. Что очень сильно повышает качество распознавания, когда у вас есть терминология, сленг. То есть, вы можете не предобучать на этих записях, а просто подсунуть такой словарик специальных терминов. Например, у вас какие-нибудь радиоперехваты геодезистов, где очень много терминов. И тогда транскрибирование пройдет с очень… качество повысится в разы просто из-за этого. Ну и, соответственно, сейчас примеры локального анализа. То есть, решения могут быть как от ноутбука, так и до серверной группы. То есть, например, у нас есть решение на ноутбуке, когда обрабатывается моноязыково.

То есть, в каждый момент времени у вас на одном языке обрабатывается. Если у вас запись многоязыковая, то просто обработка будет происходить немножко дольше. Потому что он будет переключаться между языками. На рабочей станции уже можно осуществить поддержку многоязыковости параллельную. Ну и скорость увеличивается. Ну и, соответственно, дальше в зависимости от объема данных серверное решение идет…

Здесь сразу примеры визуализации портала накопления архива обработанных данных. Ну, здесь именно про видеоданные идут. Но, в принципе, решения индексации и визуализации, они под все типы данных сразу подрисованы. То есть, вы, когда обработали все эти многоформатные данные, вы дальше ищете уже как в едином портале по всем им. То есть, вы задаете запросы, он ищет и в видео, и в аудио, и в текстовых данных.

Обработка видео. Подробнее еще раз остановлюсь. Это поиск необходимых кадров, их классификация, поиск лиц, заданных или неизвестных. То есть, он может просто обработать ваш архив, большой архив видеозаписей и разложить вам кластеры людей, что вот на этой видеозаписи встретились такие-то люди. А вот они там в разных, ну, в разной одежде, в разном возрасте и так далее. Просто где они были, встречались ли они вместе на одном видео. Дальше уже широта аналитических задач зависит только от воображения.

Делаются специальные временные метки, чтобы перейти сразу к нужному лицу, эмблеме, высказыванию. Есть такой редактор для подготовки отчетных материалов. То есть, когда вы можете нарезать необходимые вам участки и сделать такое итоговое отчетное видео. Снабдив его еще там на другой странице текстовым отчетом. А также немаловажная вещь — это обработка видео именно не с точки зрения транскрибации, когда на нем разговаривают люди, а с точки зрения описания происходящего на видео. Особенно, если записи длинные или там никто не разговаривает. Тут тоже широта задач не ограничена. Это, ну, как получение краткого реферата, например, девятичасового видео, где ничего не происходит.

С первого по восьмой час у вас там деревья, ветер. Забор и проезжает пять машин. А там с восьмого часа там заходят люди, что-то происходит. То есть это очень часто как бы сокращает время работы аналитика. Когда он читает такой реферат, он сразу либо видит, что надо перейти к такому участку, либо вообще видит, что интересующего ничего нет. Хорошо работает, например, на заданных тематиках. То есть когда мы ищем видео, например, хакерской тематики, видео каких-то суицидов или драк. Или просто мы ищем, опять-таки же, когда у вас есть какая-то запись видеонаблюдения уличной камеры, что за 24 часа проехало две машины, во столько-то, во столько-то, во столько-то, а еще во столько-то прошла группа людей.

То есть, опять-таки же, из 24 часов мы получаем три фрагмента по две минуты, которые необходимо проанализировать глубже.

Классификация изображений — это могут быть как картинки, так и, собственно говоря, видеокадры. Опять-таки же, группы задаются, исходя из ваших задач. Могут быть как общие такие, как портрет, пейзаж, карты, так и какие-то специализированные, например, пометки на фотографии, или там нахождение документов, документов печатных или рукописных, документов официальных, или просто документы на столе, и так далее.

Отдельный блок распознавания документов упомянул, потому что задача такая специфическая. Мы тоже работали над большими наборами документов, как печатных, так и рукописных. Получили довольно хорошие результаты и качество. Опять-таки рассчитано на то, что, например, вы… Ну, тут даже про большие архивы говорить не стоит. Тут даже снятые данные с телефона — это уже огромный массив данных, который там глазами просматривать, надеюсь, уже никто не пытается, потому что 200 гигабайт каких-то фотографий и файлов просмотреть уже невозможно. Если только у вас много времени и свободного.

Следующий блок — это тоже пример такой же конкретной задачи работы с фотографиями, то есть, например, описание того, что происходит на фотографии, скриншоте, аватарке и так далее.

Работа с текстовыми данными, то есть анализ больших объемов текст-данных. Здесь на примере открытых данных из интернета. Опять-таки же то же самое — снятые данные с телефона, флешки, компьютера. Это могут быть полнотекстовые документы, но могут быть документы вида чат. Идет классификация, выделение авторов, анализ связей. Если где-то упоминаются фактографические данные, то есть имена, название организации, адреса, телефоны и так далее. Ну и отчетный портал, который позволяет сверху свои запросы сохранять, добавлять руками.

Огромный архив проиндексированных текстов, десятки терабайт. У вас позволяет искать в нем за секунды необходимую информацию, ограничивать по каким-то атрибутам. Время, как пример здесь. Тип файла, откуда это нашлось, извлечение, откуда это нашлось и так далее. Примеры, как я уже упомянул, классических алгоритмов классификации текстов, которые сейчас все-таки мы применяем параллельно с AI. Потому что на каких-то задачах, когда у вас есть жестко заданная рубрика, они работают и быстрее, и более качественно.

На самом деле, как правило, классификаторы мы создаем под задачи, под заказчика. Есть уже какой-то большой объем наработанных классификаторов каких-то стандартных тем. Даже специализированных, которые у нас уже реализованы. Специальные лингвисты работают для этого, уточняют и так далее. Как правило, я говорю, они работают в каком-то наборе.

Пример визуализации разнородных данных. Еще раз такой портал, куда сливаются данные всех перечисленных типов. И вы ищете уже сквозь него, вам уже неважно, откуда это пришло, из закрытого источника, из какого-то диска или из интернета. Архив позволяет искать сразу во всём. Соответственно, он многопользовательский. Каждый аналитик может иметь свой набор рубрикаторов. То есть кто-то там работает по теме 1, кто-то по теме 2. Он, когда заходит под свою учетку, он видит именно материал, отобранный по его теме. Может сверху их уточнить, дополнительный запрос задать, ограничить по времени, отобрать материалы в квартальный отчет, в текущий отчет, в годовой отчет и так далее.

То есть система подборок. Такие довольно стандартные режимы уже порталов анализа. Соответственно, представление информации в виде карточек, текста, карт, графов и так далее. Переход, как в примере с видеоданными, в какой-то специализированный редактор по типу данных. Это все реализовано. Опять-таки же, как правило, при, допустим, автоматизации какого-то подразделения идет донастройка под нужды этого подразделения.

Мы общаемся, как работа устроена сейчас, как люди это делают сейчас с руками или на какой-то другой системе. И, в принципе, все эти визуальные формы, они дотачиваются для потребителя.

Вопросы из зала

Вкратце все. Если есть вопросы, готовы отвечать.

— Коллеги, большое спасибо. Ваши вопросы. Ага, вижу.

— Здравствуйте, спасибо за доклад. По первому блоку хотелось бы уточнить момент. Возникает потребность на устройствах воспроизвести условия обычной эксплуатации. И есть ли такой блокиратор, который позволяет полностью транслировать устройство, источник, для того, чтобы его можно было подключить в сам персональный компьютер, ноутбук, и выполнить включение, когда требуется от блокиратора не транслирование данных контроллера, а транслирование данных самого накопителя, источника, то есть это интерфейс, серийный номер, SMART и так далее. Потому как обычные блокираторы просто транслируют данные контроллера, который производит блокиратор, выполняет блокиратор.

Здесь именно данный момент реализован частично и дальше реализовывается в блокираторе, который новый USB 3.0. То есть в SATA-блокираторе мы такой не поддерживаем. И второй вопрос по MIME-типам. То есть можно ли будет с помощью вашего продукта обнаружить, например, архивы или криптоконтейнеры, маскирующиеся под какие-то типы данных, картинки, видео, какие-нибудь распространенные форматы, типа GGUF-файлы под модельку языковую, замаскированные, ну, типа криптоконтейнеры, названные с расширением GGUF. Можно ли это будет сделать? Да, здесь такое можно будет сделать. У нас вообще как по MIME-типам реализовано. У нас есть определенные группы MIME-типов, которые мы изначально для пользователей сделали.

Допустим, аудио, архивы, как вы уже сказали, изображения. И также у нас доступна пользовательская группа, куда вы можете добавить все необходимые вам MIME-типы файлов. И еще здесь же хотелось бы отметить, что требуется иногда возможность выполнить поиск всех зашифрованных типов, возможных на устройстве. Возможно ли это будет реализовать поиск именно зашифрованных архивов, маскирующихся под какие-то распространенные форматы файлов? Честно говоря, в данном направлении пока что не работали. То есть здесь нужно именно с разработчиками пообщаться. Но я вас услышал, мы эту тему поднимем обязательно. По второму блоку хотелось бы уточнить вопрос, как это решается.

С помощью локальной модели на стенде, которая развернута у экспертов. Или это онлайн какое-то исследование? Как правило, все эти системы стоят локально. То есть я говорю, мы делаем такое комплексное решение, которое может быть даже двухзвенным. То есть открытый контур, закрытый контур. И это все у вас выполняется непосредственно. Почему я упомянул, что данные с открытых источников и служебных могут соединяться в одном архиве. Естественно, это не в облаке происходит. Это вопрос касательно характеристик. Какими характеристиками должен обладать стенд для воспроизведения в условии работы модели? И как решается вопрос контекста? То есть мы же понимаем, что сейчас основной проблемой является размер контекста, который в пределе 1 миллиард токенов.

Как решили эту проблему вы? И какие модели используются? С какими параметрами? И как сделать так, чтобы после большого набора данных, модель не начала путаться как в системном промпте, так и во внутренних инструкциях и так далее. Железо подбирается в зависимости от задачи, естественно. То есть сколько вы хотите обрабатывать, как быстро.

Привел пример от ноутбука до бесконечности. По поводу всех остальных вопросов, как сказать. Еще раз, модель ищет во всем архиве. То есть если у вас терабайта, он уже проиндексирован. У нее есть схема этого архива. И она ищет глубина контекста, то есть то, что вы у нее спрашиваете. Но она ограничена тоже, в принципе, стандартными вещами. То есть, как правило, это, например, две видеокарты, которые разворачивают 38 или 72 модель размера. То есть тут никаких специальных вещей нет. То есть контекст запроса, он, естественно, ограничен. Но для анализа архива, который уже структурирован, и построена схема его, там вполне всего достаточно. То есть он через весь архив осуществляет поиск.

Коллеги, еще вопросы? Давай через поднятую руку.

Подскажите, пожалуйста, USB-блокиратор. Каково техническое решение? Там тоже микрокомпьютер или там сигнальный процессор? Смотрите, там мы используем микрокомпьютер. И в дополнение к этому наше модульное решение. То есть мы используем не сам компьютер, а именно мозг от него. Дальше уже разводится также наша плата, которая к нему подключается. И вот такая происходит работа. То есть блокировка все-таки программная? Внутри изделия, да. Спасибо.

— Вижу руку, бегу. А можете ее задержать вверх? Потому что я ее теряю в рядах. Спасибо.

— Здравствуйте. Вопрос по программному продукту «Элемент ВД». Вы можете назвать ключевые его преимущества по сравнению с конкурентами? Или это просто альтернативно, что это российское ПО? Ну, первое, да, то, что вы сказали. Это именно российское ПО. И, наверное, основное преимущество, какое есть, это работа на Astra Linux. И работа, ну, сейчас не знаю, R-Studio. Да, она вроде работает с файлами E01.

То есть основная у нас была такая масштабная задача. Это работа с файлами E01 на компьютерах с операционной системой Astra Linux. Я понял, спасибо.

— Спасибо. Так, коллеги, у нас осталось время на еще один вопрос. Слава, вижу. Давайте, ладно, два. Так, коллега, сначала давайте вы. Вы первые подняли. Да, спасибо за доклад. Хотел бы спросить, вот вы когда к нам в гости приезжали, я вас спрашивал уже, как у вас работа с прерываниями во время создания образа E01. То есть вы тогда сказали, что не знаете о таких решениях. Я вам подсказал, что они уже на рынке есть, и вы хотели уточнить и к себе, если что, их добавить. То есть если создаем образ E01, диск отвалился, все остановилось, у вас все это заново надо начинать было, а есть на рынке продукты, которые могут продолжить.

Ну, если вы нам скажете, какой это продукт, мы хотя бы сможем посмотреть, как это приблизительно работает, потому что, исходя из той информации, которой мы владеем, сам формат E01, он просто не поддерживает прерывания, так как в нем в самом идет подсчет контрольных сумм, и при прерывании этот момент уже корректно произвести не получится. Я вам уже говорил: Belkasoft, Tableau, можете посмотреть. У Tableau разве такое есть? Да.

Мы обратим внимание, хорошо.

— Так, добрый день. Скажите, пожалуйста, вот эмоциональное состояние каким способом оценивается? Вот у вас там было написано. Ну, эмоциональное состояние по окрасу текста. То есть вы про аудиозаписи? Не-не-не, у вас в аудиозаписи. В аудиозаписи. Ну, по аудиозаписи, по тембру, естественно. По тембру, паузам. Ну, кто-то просто громче говорит, кто-то тише там, еще что-то. Нет, ну, он же оценивает. Какая-то научная работа проводилась или просто вот вам так?

Какая-то научная работа проводилась, это уже есть стандартные решения для этого. Ну, ясно, хорошо. И еще, как будет описано, какими словами драка, допустим? Машет руками, там, еще что-то, потому что там стоит и что-то делает, это, конечно, хорошо? Ну, он же оценивает динамику видео, то есть если, ну, вот, условно говоря, там, он описывает, что производится драка, потому что… Ну, нет, там может быть бьет, может быть вот что, понимаете? Нет, ну, знаете, внутрь драки, типа тип драки, он не разбирает, он просто говорит, что группа людей… Я не про это. Для чего это нужно? Допустим, большое количество видеоизображений, на которых может быть какие-то противоправные действия.

И вот если оно у вас там текстово выдаст, то по тексту тоже можно будет осуществлять поиск. Да, да. Вот. А что искать-то? Ну… А вот. Вот какими словами она пишет, чтобы было понятно… Смотрите, как правило, как правило, вот я там пример был, запрос, он пишется не одним словом, а группой слов с, ну, специальными лингвистическими терминами. И когда вот ставится вот такой портал анализа, делается библиотека запросов.

Потому что слова, которые написаны, могут быть разными. Может быть просто люди активно двигаются, приближаются друг к другу, да, там, то есть на самом деле там не может быть в явном виде слова «удар». «Драка», потому что его может не быть, да, там, они могут близко стоять друг к другу, толкаться там, и кто-то вот так кого-нибудь там пырнул ножом, да, например. И в явном виде это может быть написано. Но вот сверху лингвистический запрос, который, он должен учесть все эти нюансы, как бы, ну, например, проработав на тестовой выборке там, да. Ну, то есть сначала надо изучить, что вы выдаёте, а потом уже думать, что… Ну, не то, что мы выдаём, а то, что скорее мы хотим искать.

А дальше уже лингвисты сами на это настроят запросы. То есть это будет не просто слово или два слова, это будет такой, как мини-классификатор прям по факту. Нет, я понимаю, только обычно это не лингвисты делают, а другие эксперты, компьютерщики. Нет, ну, лучше, чтобы лингвисты, потому что они лучше семантику понимают операторов, как эти слова правильно связать. И ещё, в какой форме словарь-то делается, допустим, по специфическим терминам? Это просто текст? Или надо всё-таки слово произнести и текст? Нет, нет, нет, это текст.

В данных типах аудиозаписей могут встречаться вот такие специфические слова, да? То есть, я говорю, какие-то термины, сленги, да? Потому что при транскрибации штатной он, ну, может не иметь в контексте вот это вот специализированное слово. Он скорее его распознает как какое-то более общедоступное слово. Когда вы задаёте, что есть какие-то там клички, там, не знаю, спецтермины, он приоритетнее будет их искать, да. Да, задаётся, ну, просто слово. Слово, Enter, слово, словосочетание там.

— Заключающий уже, извините, у нас.

— Раз, раз. Вопрос в продолжении предыдущего вопроса. Хотелось бы узнать, что, как у вас реализована повторяемость результатов? То есть, часто проблемой анализа с помощью ИИ это изменение результатов вывода. Как у вас это решено? То есть, это понятно, что можно сделать понижение температуры, фантазирование модели. Как у вас реализована повторяемость результатов? Чтобы, например, анализ видео сначала произведён таким образом, и результаты получены такие, а потом иногда модель начинает выдавать иные результаты после анализа. И как это реализовано у вас? Это очень важно для экспертного исследования и результатов анализа. В проработке одного и того же видео два раза или разных видео?

Да, да, да. Там заданный параметр жёстко. То есть, повторяемость результата будет очень высокой. Вообще. Это как вот это придумывание, фантазирование нейронки. Оно при вот таком анализе практически… Ну, оно не выключено, так нельзя его выключить, да? Но оно сильно ограничивается. Потому что иначе при транскрибировании, например, аудио или видео, там будет произвольный текст, который похож на что-то. Поэтому там жёстко мы ограничиваем параметры. Ну, мы делаем предобработку, нарезку. Ну, по-моему, для звуковых дорожек, да? И, соответственно, вот её полёт фантазии ограничен очень сильно, да. Поэтому для каждого языка идёт свой набор моделей. Как бы, например, для нарезания и предобработки видеофайла идут свои модельки маленькие, да?

То есть, там идёт какой-то стек моделей.

— Коллеги, большое спасибо. Я напомню, что у ребят здесь есть стенд. И пообщаться вы с ними можете сегодня в течение целого дня. Давайте проводим их аплодисментами. Можно оставить там, пожалуйста. Спасибо большое.