Skupina STRADE prezentuje na konferenci IJCB 2026 (IEEE International Joint Conference on Biometrics), jedné z předních konferencí v oblasti biometrie, dva příspěvky. Oba se zabývají rozpoznáváním identity pomocí moderních neuronových architektur, každý se však věnuje odlišné modalitě: první rozpoznávání tváří na výpočetně omezených zařízeních, druhý ověřování autorství textu.
Rozpoznávání tváří pro koncová zařízení
Nasazení výkonných modelů pro rozpoznávání tváří na zařízeních s omezenými výpočetními zdroji, jako jsou mobilní telefony nebo bezpečnostní kamery, je omezeno kapacitou odlehčených sítí. Běžně používaným řešením je destilace znalostí, při níž jsou znalosti přenášeny z rozsáhlého učitelského modelu do menšího studentského. Standardní destilace však nutí studentský model napodobovat i nespolehlivé výstupy učitele a nezohledňuje rozdílnou kvalitu vstupních snímků.
Navržená metoda kombinuje techniku Grouped Knowledge Distillation s přístupem MagFace, který zohledňuje kvalitu vzorku. První složka filtruje neinformativní logity na úrovni výstupu, druhá zakóduje kvalitu snímku přímo do geometrie příznakového prostoru. Obě složky tak působí na komplementárních úrovních trénovacího procesu. Výsledný studentský model dosahuje více než čtyřnásobné propustnosti při inferenci ve srovnání s učitelským modelem.
Nejlepší konfigurace dosáhla nejvyšší přesnosti na datasetu CFP-FP mezi porovnávanými metodami (96,24 %) a srovnatelných výsledků na datasetu AgeDB-30 (96,78 %). Studentský model navíc přebírá schopnost učitele odhadovat kvalitu snímku a přiřazuje vyšší hodnoty magnitudy příznaků kvalitnějším snímkům tváří.
Ověřování autorství textu
Ověřování autorství, tedy rozhodnutí, zda dva texty pocházejí od téhož autora, představuje úlohu behaviorální biometrie. Zásadním omezením současných systémů je jejich implicitní závislost na sémantické podobnosti: často zaměňují tematickou shodu za shodu autorskou, a mají tak potíže správně vyhodnotit tematicky odlišné texty téhož autora, případně chybně spojují texty různých autorů se společným tématem.
Navržený přístup se odklání od tradičních řešení založených na enkodérech a využívá architekturu typu decoder-only (Qwen3). Autoregresivní předtrénování dekodéru na predikci následujícího tokenu vede model k zachycení stylistických charakteristik autora, nikoli pouze obsahu textu. Oba texty jsou spojeny do jednoho vstupu, což modelu umožňuje vzájemnou interakci mezi dokumenty prostřednictvím kauzálního attention mechanismu. Model je dotrénován výhradně metodou LoRA aplikovanou na projekční matice attention vrstev, zatímco zbylé váhy zůstávají zmrazené. Součástí přístupu je rovněž strategie těžby trénovacích párů zaměřená na obtížné případy, která model vede k rozlišování na základě stylu, nikoli tématu.
Nejlepší konfigurace (Qwen3-4B) dosáhla hodnoty ROC-AUC 0,9903 na vlastním testovacím datasetu a 0,9462 na cross-domain benchmarku PAN21, a to bez trénování na datech tohoto benchmarku. V porovnání se soutěžními systémy PAN21 se navržené řešení umístilo nad několika přístupy, které měly na rozdíl od něj k dispozici trénovací data daného benchmarku.
Význam
Oba příspěvky ukazují, že moderní neuronové architektury lze efektivně adaptovat na náročné biometrické úlohy. V prvním případě umožňují spolehlivé rozpoznávání tváří přímo na koncových zařízeních bez zásadního kompromisu mezi rychlostí a přesností, ve druhém představují nástroj pro ověřování autorství, jehož význam roste s rozvojem generativní umělé inteligence, a to jak pro forenzní analýzu, tak pro ochranu digitální identity.
Tomáš Goldmann, Samuel Šimún
Magnitude-Aware Knowledge Distillation for Lightweight Face Recognition
Samuel Šimún, Tomáš Goldmann
Semantics-agnostic Authorship Verification: Disentangling Style from Content using Specialized Decoder Architecture
IJCB 2026 — IEEE International Joint Conference on Biometrics
Podpořeno FIT VUT Brno, grant FIT-S-26-9011, a projektem e-INFRA CZ (ID:90254).