Определить поддельный голос на слух становится всё сложнее. В майском исследовании Fraunhofer AISEC участники правильно распознали настоящие записи лишь в 64,1% случаев – пять лет назад этот показатель составлял 72,7%. При этом точность распознавания подделок почти не изменилась. Как показал эксперимент University College London, даже тренировка на примерах синтезированной речи улучшает результат менее чем на два процентных пункта. Поэтому надёжнее не вслушиваться в голос, а проверять личность другими способами: положить трубку и самостоятельно перезвонить по номеру из записной книжки, задать вопрос, ответ на который знает только настоящий собеседник, или заранее договориться о семейном пароле. Ещё один способ – попросить человека выполнить необычное речевое задание прямо во время разговора. В эксперименте набор из 11 таких заданий повысил качество распознавания подделок с 56 до 86,7% AUC.
Обратный звонок: номер из записной книжки, а не с определителя
Единственная проверка, которую не обходит ни одна система синтеза, – смена канала связи. Немецкая полиция на странице профилактики шоковых звонков советует класть трубку сразу, поясняя, что это не грубость, а способ получить паузу и собраться с мыслями. Дальше нужно связаться с родственником или доверенным человеком по номеру, который уже известен.
Слово «известен» здесь несёт всю нагрузку. Не кнопка повторного вызова, не номер с определителя, а запись из собственной телефонной книги: отображаемый номер подделывается, и совпадение с номером родственника ничего не подтверждает.
Оговорка обязательна. На попытку проверить звонящие отвечают плачем, давлением по времени и передачей трубки мнимому адвокату или врачу – сценарий рассчитан на то, чтобы не дать положить трубку. Поэтому последовательность жёсткая: сначала разорвать соединение, потом набрать самому. Задавать вопросы, не прерывая разговор, смысла мало.
Отсюда же вытекает правило про деньги. Полиция формулирует его короче любого объяснения: не передавать наличные и ценности посторонним, включая тех, кто представился сотрудником полиции. Сообщать о случившемся стоит и тогда, когда дело осталось попыткой – иначе схему не увидят в статистике.
Пароль на случай шока и вопрос, который не угадать
Второй рубеж выстраивается заранее. В предупреждении центра IC3 ФБР от совет сформулирован без оговорок: придумать с членами семьи секретное слово или фразу для подтверждения личности.
Немецкая полиция предлагает более устойчивый вариант – спрашивать о том, что может знать только настоящий родственник или знакомый. Разница практическая: пароль под шоком забывается, а кличка семейной собаки из 1998 года не забывается и не угадывается. Языковая модель её не подберёт, потому что таких сведений нет ни в открытых источниках, ни в переписке.
Требования к паролю следуют из способа его взлома. Не имя, не улица, не название города, не год выпуска – всё это ищется по социальным сетям за несколько минут. Годится сочетание слов без логической связи или семейная шутка, которую никогда не публиковали. Проговаривать пароль стоит вслух и не хранить в переписке.
Преобразование голоса (voice conversion) – схема, при которой говорит живой человек, а система подменяет только тембр. Интонация, эмоции, дыхание и способность ответить на вопрос остаются человеческими, поэтому для интерактивного звонка пригодна именно она, а не синтез речи по тексту.
Одиннадцать речевых заданий из эксперимента Нью-Йоркского университета
Проверка внутри самого разговора построена на схеме «запрос – ответ». Собеседника просят сделать со своим голосом что-то нетипичное, и система преобразования, обученная на обычной речи, даёт заметные искажения. Работа Нью-Йоркского университета, опубликованная , впервые измерила эффект по каждому заданию отдельно.
Исследователи собрали 18 600 оригинальных записей от 100 добровольцев и сгенерировали из них 1,6 млн подделок системой FreeVC. Из 20 заданий рабочими оказались 11. Без задания автоматический детектор показывал 56% AUC – чуть лучше подбрасывания монеты. С отобранными одиннадцатью – 86,7%, а люди на том же наборе дали 80,1%. Одно задание занимает у говорящего около шести секунд.
AUC – площадь под ROC-кривой, сводная мера качества классификатора. 50% соответствует случайному угадыванию, 100% – безошибочному разделению настоящих и поддельных записей.
| Задание | AUC детектора | Оценка |
|---|---|---|
| Фоновая инструментальная музыка | 98% | рабочее |
| Ладонь, прикрывающая рот | 97% | рабочее |
| Произнесение иностранных слов | 97% | рабочее |
| Шёпот | 92% | рабочее |
| Речь поверх чужой речи | 90% | рабочее |
| Высокий тон | 86% | рабочее |
| Неподвижные губы | 85% | рабочее |
| Фоновая песня со словами | 85% | рабочее |
| Заданная эмоция в голосе | 82% | рабочее |
| Пение | 71% | рабочее |
| Тихая речь | 71% | рабочее |
| Быстрое чтение | 67% | слабое |
| Низкий тон | 65% | слабое |
| Зажатый нос | 63% | слабое |
| Громкая речь | 62% | слабое |
| Вопросительная интонация | 60% | слабое |
| Другой акцент | 57% | слабое |
| Обычная речь без задания | 56% | слабое |
| Медленное чтение | 55% | слабое |
| Кашель или свист | 54% | слабое |
| Хлопки в ладоши | 51% | слабое |
Два верхних задания требуют второго устройства с музыкой и для звонка пожилому родственнику не годятся. К обычному разговору применимы четыре: попросить перейти на шёпот, произнести фразу высоким тоном, прикрыть рот ладонью, повторить редкое иностранное слово. Просьба сменить акцент, покашлять или хлопнуть в ладоши бесполезна – преобразование голоса воспроизводит это без заметных потерь, а хлопки детектор вдобавок принимает за шумовые пики.
Задания опубликованы, поэтому фразу и слово выбирают на месте. Иначе противник заранее запишет чистый ответ и просто проиграет его в трубку.
У метода есть срок годности. Подделки в эксперименте генерировала система FreeVC образца 2023 года, а по данным слухового исследования Fraunhofer коммерческие сервисы обходят человеческое ухо заметно лучше открытых моделей. Проверок этих цифр на нынешнем поколении систем пока не публиковали, так что речевое задание снижает вероятность ошибки, но не заменяет обратный звонок.
Отдельный результат касается подсказок. Без помощи автоматики участники угадывали в 72,3% случаев, с подсказкой детектора – в 78,5%, а при передаче спорных решений машине – в 82,9%. Когда человек ошибался, а детектор был прав, человек менял решение в 43% случаев; в обратной ситуации детектор сбивал его с толку в 29%.
Запись в телефонном справочнике выдаёт возраст владельца
Механизм, о котором знают меньше всего, работает до звонка и уменьшает шанс вообще попасть в выборку. Немецкая полиция описывает отбор жертв прямо: мошенники берут списки из телефонных справочников, а старомодное имя или короткий номер сообщают им, что за записью стоит пожилой человек.
Тем, кто хочет остаться в справочнике, рекомендуют сократить имя до инициала; готовая форма для оператора связи лежит на той же странице. Пострадавшим от телефонного мошенничества смена номера обычно обходится бесплатно.
Сюда же относится гигиена публикаций. Образец для клонирования берут из открытых видеозаписей и голосовых сообщений, а вопросы для проверки личности теряют смысл, если ответы на них выложены в социальных сетях.
Почему списки признаков и тренировка слуха не работают
исследователи Fraunhofer AISEC опубликовали крупнейший на сегодня слуховой эксперимент по синтезированной речи: 1768 участников, 35 532 оценки, 138 систем синтеза и преобразования голоса. Сравнение шло с базовым замером 2021 года, где было 472 участника и 13 систем.
Точность на подделках почти не изменилась – 72,9% против 71,2%. Обвалилась вторая половина: настоящие записи стали относить к настоящим лишь в 64,1% случаев против 72,7% пятью годами раньше. Люди не разучились слышать синтез, они разучились верить живому голосу. Авторы работы назвали это сдвигом скептицизма. Для защиты вывод неприятный: совет вслушиваться внимательнее двигает не тот порог, который нужно.
Отдельно измерили, какие системы обманывают лучше. Сложнее всего участникам давались коммерческие сервисы и системы на основе языковых моделей – от 61,3 до 65,9%. Проще всего распознавались старые архитектуры seq2seq и flow-matching – от 75,4 до 76,8%. То, что оформляется подпиской за пару минут, звучит убедительнее лабораторных разработок.
Тренировка слуха тоже не спасает. В работе University College London, опубликованной в PLOS ONE , 529 участников распознавали подделки в 73% случаев, причём одинаково на английском и китайском. Знакомство с образцами синтеза подняло площадь под ROC-кривой с 73,83 до 75,54% – прибавка в пределах статистического шума. Английские участники ссылались на дыхание, китайские – на ритм и паузы между словами, и обе группы ошибались одинаково часто.
Устарел и совет ловить задержку. Замеры компании Koe AI на обычном настольном процессоре без видеокарты дают методу LLVC 19,7 мс задержки, QuickVC – 97,6 мс, RVC – 189,8 мс. Мобильное соединение само по себе добавляет от 100 до 200 мс, так что слой преобразования в 20 мс тонет в линии.
Детекторы теряют точность на телефонной линии
В слуховом эксперименте Fraunhofer автоматический детектор держался выше 94,5% при любых условиях, пока люди проваливались до 64,1%. Напрашивается вывод, что задачу решает программа. На телефонном звонке он не подтверждается.
В работе, представленной на Interspeech 2025, синтезированные записи проигрывали через громкоговоритель и снимали микрофоном – 109 комбинаций оборудования, шесть языков, 132,5 часа звука. Лучшая из открытых моделей, W2V2-AASIST, ушла с 4,7 до 18,2% равного уровня ошибок. Дообучение на импульсных характеристиках помещений сократило провал до 11,0%, но не устранило. Показательна асимметрия: точность на настоящих записях не изменилась вовсе, просела только на поддельных. Проигрывание через воздух стирает как раз те следы синтеза, за которые цепляется детектор.
Равный уровень ошибок (EER) – доля ошибок в точке, где частота ложных срабатываний совпадает с частотой пропусков. Чем ниже значение, тем лучше работает детектор.
Телефонный звонок проходит примерно тот же путь: громкоговоритель, микрофон, кодек, потери пакетов. Тот же вывод даёт независимая проверка на материале из открытых источников: в наборе Deepfake-Eval-2024 собрали 56,5 часа звука с 88 сайтов на 52 языках, и площадь под ROC-кривой у аудиомоделей упала на 48% относительно академических наборов.
Про доступные пользователю инструменты оговорка отдельная. Бесплатные расширения для браузера от Hiya и NordVPN разбирают звук в активной вкладке – ролик в социальной сети, запись интервью, голосовое сообщение, выложенное на страницу. К разговору в трубке они не подключаются и от шокового звонка не защищают.
Заключение
Обязанность маркировать синтезированные голоса действует в Евросоюзе с , штрафы доходят до 15 млн евро, но применяются они к компаниям с адресом и оборотом, а не к анонимным звонящим из-за границы. Ждать отметки бессмысленно, вслушиваться – вредно: попытка слушать внимательнее смещает порог недоверия к настоящей речи, а не к поддельной.
Порядок действий при тревожном звонке короткий и не требует ни техники, ни навыка. Положить трубку, не объясняя причин. Перезвонить самому – по номеру из записной книжки, а не по кнопке повторного вызова. Спросить то, что известно только настоящему собеседнику, а не то, что лежит в открытом доступе. Ничего не передавать до подтверждения по второму каналу и сообщить в полицию, даже если дело осталось попыткой.
Речевое задание вроде шёпота или редкого иностранного слова годится как быстрая проверка внутри разговора и стоит шести секунд, но обратный звонок не заменяет. Остальное делается заранее, пока никто не звонит: пароль в семье, вопрос с ответом, которого нет в социальных сетях, сокращённое имя в телефонном справочнике и разговор с пожилыми родственниками до того, как позвонят им.