Především v Asii je zájem o nástroje od brněnské firmy Phonexia. Dokážou odhalit deepfake podvody, při nichž umělá inteligence napodobuje hlasy politiků nebo celebrit.
Nejen falešná videa, velkým problémem se stávají i umělé hlasy vygenerované umělou inteligencí. Ty dokážou věrně napodobit politiky, celebrity i rodinné příslušníky a často slouží k podvodům. Brněnská společnost Phonexia proto vyvinula technologii, která dokáže odhalit, zda hlas skutečně patří konkrétnímu člověku, nebo ho vytvořila AI. „Umíme určit, jestli je nahrávka autentická, nebo jde o deepfake,“ říká produktový manažer Phonexie Jiří Nezval.
Česká firma nabízí nástroje především bezpečnostním složkám a policii, které je využívají při odhalování podvodů. Rychle se ale uplatňují i v komerční sféře, od call center po bankovní sektor. „Zájem je globální, ale největší poptávku vidíme v jihovýchodní a jižní Asii,“ říká Nezval. Důvod je zřejmý – právě v Asii se masově rozšířil takzvaný voice phishing, tedy telefonní podvody, při nichž pachatelé napodobují hlasy známých osob či autorit.
Každý měsíc se může objevit nový model, na který musíme reagovat. Je to podobné jako u antivirových programů.
Významným trhem je i Latinská Amerika a rostoucí poptávku zaznamenává také Evropa, a to včetně českých bezpečnostních složek. V tuzemsku je Phonexia zatím jedinou firmou, která technologii pro detekci hlasových deepfake nabízí.
Systém spočítá pravděpodobnost, s jakou se jedná o podvod
Benefitem je mimo jiné možnost kombinovat software s technologiemi pro hlasovou biometrii a řečovou analytiku či nasazovat ho přímo na infrastruktuře zákazníka, bez připojení k internetu, což je pro státní instituce klíčové.
Používání systému je přitom jednoduché. Uživatel nahraje zvuk a software vrátí číselné vyjádření pravděpodobnosti, že jde o deepfake. Podle firmy přitom systém dosahuje přesnosti přes 96 procent, a pokud je k dispozici i originální nahrávka hlasu, může být spolehlivost až 99 procent.

Phonexia spolupracuje s vědci z brněnského Vysokého učení technického a využívá neuronové sítě trénované na stovkách typů syntetických hlasů. „Je to jedna z nejtěžších výzev v oblasti zpracování řeči. A také hra na kočku a myš. Každý měsíc se může objevit nový model, na který musíme reagovat. Je to podobné jako u antivirových programů,“ popisuje Nezval.
Mezi trendy, které firma aktuálně sleduje, patří také detekce takzavného watermarkingu – neslyšitelných značek vložených do syntetického audia. „Funguje to podobně jako vodoznak na dokumentu. Běžný posluchač ho nepostřehne, ale technologie ho dokáže rozpoznat,“ přibližuje Nezval. Pokud by tuto metodu začali poskytovatelé umělých hlasů používat systematicky, mohla by se stát účinnou ochranou proti zneužití.
