Инструкция бета-тестера
Спасибо, что согласились помочь. Söylä Tatar превращает татарскую речь в текст. Сервис работает бесплатно: оплата не принимается, тарифов сейчас нет.
Как начать
Доступ открыт только для почты, которую вы указали в опросе. Регистрации на сайте нет — аккаунт TatarID на эту почту мы создаём сами.
- На главной нажмите «Войти» в правом верхнем углу, затем «Войти через TatarID».
- Первый раз: нажмите «Забыли пароль?», введите почту из опроса и придумайте пароль по ссылке из письма. Письмо может попасть в «Спам».
- Дальше входите с этой почтой и паролем.
Если вы уже пользуетесь TatarID на anobject.tatar с той же почтой — просто войдите со своим паролем. Если пишет «доступ только у участников» — напишите на mslmtatsoft@yandex.ru, проверим.
Как распознать запись
Загрузить файл. Перетащите аудио в поле или нажмите на него и выберите файл. Форматы: WAV, MP3, OGG, FLAC, M4A.
Записать голос. Вкладка «Записать голос» → кнопка записи → говорите → остановите. Запись можно прослушать и перезаписать.
Режим. Над кнопкой можно выбрать «Качество» или «Скорость». «Качество» (по умолчанию) режет запись по паузам и распознаёт частями — точнее и без обрывов на длинных файлах. «Скорость» отправляет весь файл одним запросом — быстрее, но на записях от ~40 минут текст может оборваться. Если попробуете оба режима на одном файле — напишите, какой получился лучше.
Дальше нажмите «Распознать речь» и подождите. Часовая запись распознаётся не дольше 10 минут. Вкладку нужно держать открытой: прогресс живёт в ней.
Если распознавание идёт дольше 10 минут — перезагрузите страницу и запустите файл заново. И напишите нам об этом (раздел 06): это как раз тот случай, который мы хотим поймать.
Готовый текст можно скопировать целиком или скачать в TXT, DOCX, RTF, MD, HTML, CSV или SRT. SRT — это субтитры с настоящими таймкодами, их можно сразу подложить в монтажную программу.
Лимиты
«Скользящее окно» значит, что лимит не обнуляется в полночь: как только с момента распознавания прошло 10 часов, эти минуты снова становятся доступными. Если лимит исчерпан, сервис так и напишет и покажет, сколько осталось.
Галочка про обучение модели
Под полем загрузки есть чекбокс «Разрешаю использовать это аудио для улучшения татарской модели». Он выключен по умолчанию.
Если вы его отметите, запись сохранится у нас и попадёт в обучающий набор для татарской модели распознавания. Набор закрытый: наружу не публикуется и никому не передаётся.
Пожалуйста, не отмечайте галочку, если:
- в записи звучат люди, которые не давали на это согласия (интервью, совещания, телефонные разговоры);
- в записи есть персональные данные, врачебная или коммерческая тайна, источники или что-то ещё непубличное.
Если галочка не отмечена, аудио используется только для того, чтобы выдать вам текст, и не сохраняется.
Само распознавание выполняется на серверах Google (Gemini API), то есть аудио во время тестирования уходит к Google независимо от галочки.
Что особенно интересно проверить
Бета нужна, чтобы поймать то, чего мы не видим на своих файлах. Больше всего помогут отчёты про:
- длинные записи — от 40 минут и дольше (там чаще всего ломается);
- шумную обстановку — улица, кафе, плохой телефонный канал;
- несколько говорящих и перебивания;
- смешанную речь — татарский вперемешку с русским;
- диалекты и нестандартное произношение;
- специальную лексику — имена, топонимы, термины, должности;
- таймкоды в SRT — совпадают ли они со звуком.
Куда писать о проблемах
Чтобы отчёт можно было использовать, приложите:
- что вы делали и что ожидали увидеть;
- что получилось вместо этого (скриншот или сам текст);
- длину и формат записи, примерное время распознавания;
- дату и время, хотя бы приблизительно — по ним мы находим логи;
- по возможности сам файл или его фрагмент, если он не конфиденциальный.
Плохое качество распознавания — это тоже баг, о нём стоит писать. Особенно полезно, когда видно, где именно модель ошиблась: пришлите кусок текста и что там было на самом деле.
Что сервис пока не умеет
- не переводит — только татарская речь в татарский текст;
- пунктуацию расставляет модель, местами она может быть спорной;
- очень тихую или сильно забитую шумом речь может пропускать;
- на длинных файлах иногда бывают редкие пропуски фрагментов — как раз это мы и ловим в бете.
Спасибо. Каждый отчёт будет рассмотрен для обновления сервиса.