За отчетный период были собраны акустические и текстовые данные. Были собраны аудиоданные без метки продолжительностью 1020 часов для казахского языка. Нами были проведена генерация коротких аудио-текстовых пар из оригинальных длинных аудиофайлов и соответствующих текстов. А объем текстовых данных составил более 1 миллиарда словоформ для казахского и татарского языков. Далее, мы разработали модели распознавания казахской речи на основе многослойных нейронных сетей на двух доступных наборах речевых данных: KazBNT и ISSAI KSC. Также мы разработали программный модуль системы каскадного перевода речи.