Upptäck homoglyfer i domäner, användarnamn och meddelanden
En homoglyf är ett tecken som ser ut som ett annat, mer välbekant tecken: kyrilliskt а (U+0430) och latinskt a (U+0061) är identiska i de flesta typsnitt men är olika kodpunkter. Detektorn kontrollerar varje tecken och listar varje dubbelgångare med position, kodpunkt, Unicode-skriftsystem och tecknet den härmar.
Genomräknat exempel
- Indata
- pаypаl.com / Αdmіn
- Hittade skriftsystem
- latinska (Latn), kyrilliska (Cyrl), grekiska (Grek)
- Flaggade tecken
- 4
| Position | Tecken | Kodpunkt | Skriftsystem | Ersättning | Regel |
|---|---|---|---|---|---|
| 1 | а | U+0430 | kyrilliska | a | Förväxlingstabell |
| 4 | а | U+0430 | kyrilliska | a | Förväxlingstabell |
| 13 | Α | U+0391 | grekiska | A | Förväxlingstabell |
| 16 | і | U+0456 | kyrilliska | i | Förväxlingstabell |
- Bevara läsbar Unicode
- paypal.com / Admin
Så fungerar det
- Varje tecken jämförs med en inbyggd tabell över vanliga kyrilliska, grekiska, latinska och fullbreddsdubbelgångare. En träff flaggas tillsammans med den ASCII-bokstav, siffra eller det skiljetecken som härmas.
- Tecken som inte finns i tabellen går igenom Unicode-normaliseringen NFKC. Om NFKC ändrar dem, som för fullbreddsbokstäver och ligaturer som fi, flaggas de som kompatibilitetsformer.
- Positioner räknas i Unicode-kodpunkter från 0. Ett ord som blandar latinska bokstäver med kyrilliska eller grekiska är en tydlig varningssignal, eftersom riktiga ord sällan byter skriftsystem mitt i.
Konvertering är den bästa ansträngningen: mappade förväxlingsobjekt och NFKC-vikning är deterministiska, men viss legitim Unicode kommer inte att flaggas.
Din text
Klistra in eller skriv — resultaten uppdateras när du skriver (lätt avstudsad för lång inmatning).
18 tecken skannade
4 misstänkta
Bevara läsbar Unicode
Original (misstänkta tecken markerade)
Misstänkta tecken i den ursprungliga vyn är understrukna och märkta "susp". förutom att markera färg.
psuspicious character аypsuspicious character аl.com / suspicious character Αdmsuspicious character іn
Rensad utdata
Teckenanalys
| Index (0-baserat) | Original | Byte | Kodpunkt | Anledning |
|---|---|---|---|---|
| 0 | p | p | U+0070 | Not flagged as a confusable or compatibility character. |
| 1 | а | a | U+0430 | Non-ASCII confusable mapped to a safer Latin ASCII equivalent. |
| 2 | y | y | U+0079 | Not flagged as a confusable or compatibility character. |
| 3 | p | p | U+0070 | Not flagged as a confusable or compatibility character. |
| 4 | а | a | U+0430 | Non-ASCII confusable mapped to a safer Latin ASCII equivalent. |
| 5 | l | l | U+006C | Not flagged as a confusable or compatibility character. |
| 6 | . | . | U+002E | Not flagged as a confusable or compatibility character. |
| 7 | c | c | U+0063 | Not flagged as a confusable or compatibility character. |
| 8 | o | o | U+006F | Not flagged as a confusable or compatibility character. |
| 9 | m | m | U+006D | Not flagged as a confusable or compatibility character. |
| 10 | U+0020 | Not flagged as a confusable or compatibility character. | ||
| 11 | / | / | U+002F | Not flagged as a confusable or compatibility character. |
| 12 | U+0020 | Not flagged as a confusable or compatibility character. | ||
| 13 | Α | A | U+0391 | Non-ASCII confusable mapped to a safer Latin ASCII equivalent. |
| 14 | d | d | U+0064 | Not flagged as a confusable or compatibility character. |
| 15 | m | m | U+006D | Not flagged as a confusable or compatibility character. |
| 16 | і | i | U+0456 | Non-ASCII confusable mapped to a safer Latin ASCII equivalent. |
| 17 | n | n | U+006E | Not flagged as a confusable or compatibility character. |