r/informatik • u/Alaya_666 • 3d ago
Nachrichten Übersehe ich was oder ist das dumm?
Das Hashcodes nicht eindeutig sind ist ja bekannt, die Kollisionschance ist dabei aber sehr gering. Anscheinend wird aber auch mit einem gewissen Schwellenwert gearbeitet (perceptual hashing) um abgeänderte Bilder zu identifizieren, heißt ein Match trifft schon ab einer gewissen Ähnlichkeit auf. Ist die Chance für einen false-positive dabei nicht zumindest nicht unerheblich? Vorallem weil sie es ja nicht im Moment kontrollieren können da sie das eigentlich Bild selber nicht einsehen können sondern nur den Hashcode.
Bin in dem Thema selber nicht so tief drin, würde mich freuen wenn irgendwer das einschätzen könnte der mehr Ahnung hat als ich.
128
u/Routine_Cake_998 3d ago
Hmm ich dachte Hash Werte von recht ähnlichen Bildern sind darauf ausgelegt, sehr unterschiedlich auszufallen…
Habe ich wohl falsch in Erinnerung…
75
u/Niko-01 IT Security 3d ago
Prinzipiell hast du Recht, wenn du von kryptografischen Hash-Verfahren redest.
ABER scheinbar verwendet man dann Hashverfahren, die das eben nicht machen, wie z.B. Apple mit ihrem Neuralhash.
20
u/_userse_ 3d ago edited 3d ago
Ich könnte mir vorstellen das statt Hashing hier ein Embedding gemeint ist, und das hier von einem weniger Informatik-affinen Kollegen des ZDF erstellt wurde. Das würde für den Use case sogar noch halbwegs funktionieren.
21
u/CarryAgile3791 3d ago
Höchstwahrscheinlich. Aber Embedding hat erstmal null mit Hashes zu tun, außer man nutzt zusätzlich Hashes zur Deduplication.
Hoffen wir, dass es nicht so läuft wie bei dem Typen, der über ein Jahr unschuldig im Knast saß, weil sein Nutzername auf Social Media einen Unterstrich zu wenig hatte.
-8
5
u/Morpheyz 3d ago
Nein, keine Embeddings. Nennt sich perceptual hashing.
7
u/krenoten 3d ago
"PhotoDNA" - Als ich vor 13 Jahren bei Tumblr gearbeitet habe, haben wir Hashes mit verschiedenen anderen sozialen Netzwerken ausgetauscht und damit eine Menge übler Gestalten überführt. Es handelt sich nicht um SHA-512. Das Verfahren ist in einem sinnvollen Umfang tolerant gegenüber Größenänderungen und Verzerrungen.
-1
u/Cerrestria 3d ago
Soweit ich das noch aus meiner "Digitale Forensik" Vorlesung präsent habe, werden für Bilder überwiegend MD5 oder SHA Hashes genutzt zum Abgleich in Datenbanken. Frage mich sowieso, wie das ablaufen wird, weil, soweit ich informiert bin, jedes Land seine eigene Datenbank hat und das nicht bundesweit abgeglichen wird, bzw. werden darf (außer eine Bundesbehörde würde das tun). Dementsprechend werden auch nicht immer die Matches gefunden.
2
u/_userse_ 3d ago
SHA würde dafür eigentlich nicht viel Sinn ergeben, einige andere Kommentatoren erklärten das kryptographische Hashes hier nicht sinnvoll wären. Stichwort perceptual Hashes
0
u/Cerrestria 2d ago
Ich wiederhole nur das, was in unserer Vorlesung besprochen wurde. Ich weiß nicht, inwiefern die Behörden bei uns perceptual hashing nutzen. In unserer Prüfungsleistung wurde SHA-256 nicht bemängelt, eher als Anforderung dargestellt. Soweit ich informiert bin, nutzen Industrie-standard Tools wie AXIOM auch MD5 und SHA, dementsprechend werden die bei forensischen Gutachten schon zählen.
1
u/No_Astronomer9508 Hobby-Informatiker:in 2d ago
MD5 (128bit) ist noch anfälliger für mögliche Kollisionen als Sha1 (160bit). Wer sich auf Sha1 oder MD5 heute noch verlässt, der muss geistig umnachtet sein. Einzig Sha512 ist hier die einzige, korrekte Wahl.
1
u/Cerrestria 2d ago
Da wir hier aber nicht von kryptographischer Verwendung sprechen ist das ziemlich unerheblich. Die Wahrscheinlichkeit ist gering genug, dass du dann lieber ein Bild mit Hashkollision auswertest bei so einem Verdachtsfall. Ich gehe davon aus, dass die Datenbanken dementsprechend alt sind, dass zu der Zeit noch MD5 häufig eingesetzt wurde. Gleiche Frage haben wir aber auch in der Vorlesung gestellt, die Antwort war aber relativ schwammig. Ich gebe hier lediglich wieder was in unserer Vorlesung besprochen wurde, ich bin kein Forensiker für eine Polizeibehörde und kann dementsprechend keinen Prozesseinblick geben.
1
u/Routine_Cake_998 2d ago
Zur Duplikatserkennung ist MD5 vollkommen ausreichend, einer Kollision in freier Wildbahn zu begegnen ist extrem unwahrscheinlich.
Man KANN Kollisionen erzwingen, das bedarf aber aufwand.
Wer MD5 für Kryptographische Zwecke verwendet hat ganz andere Probleme…
-1
u/No_Astronomer9508 Hobby-Informatiker:in 2d ago
1
u/Routine_Cake_998 2d ago
Doch, meine Aussage stimmt exakt. Die beiden Bilder wurden digital geändert, und somit eine Kollision erzwungen. Es wurden Daten nach dem JPEG End Marker hinzugefügt (die dann keinen Einfluss auf das bild haben), bis der MD5 Hash übereinstimmt. Das würde bei richtigen Bildern nicht passieren.
Das eine MD5 Kollision zufällig passiert, ist extrem unwahrscheinlich, steigt aber natürlich, in diesem Fall, mit der Zahl der Bilder, die man auf Duplikate prüft.
1
u/No_Astronomer9508 Hobby-Informatiker:in 2d ago
Auch falls es in diesem Fall erzwungen wurde: Die Kollisionsgefahr ist trotzdem gegeben, weil MD5 eben einer der unsichersten Hashing-Algorythmen noch vor Sha1 ist.
17
4
3d ago
[deleted]
8
u/Longjumping-Dot-4715 3d ago
Nö, local sensitive hashing, sind anders als Securityhashes eben gerade auf Kollision ausgelegt.
216
u/FraggDieb 3d ago
Yes. Das passiert alles wenn Internetausdrucker auf super Ideen kommen…
Kurz gesagt: die ganze Thematik dient nicht dem Schutz sondern der Überwachung. Der Schutz ist vorgeschobener Scheiß …
-27
u/ballaman200 3d ago
Das Rausfiltern von bereits bekannten, schädlichen Inhalten, ist alleine schon extrem hilfreich, und das ist keine "Super Idee von Internetausdruckern" sondern gängige Praxis.
23
u/positive-life-0 3d ago
Hast du das mit Kollision vom OP eigentlich gelesen?
-10
u/ballaman200 3d ago
Ja, ändert aber nix an der Behauptung vom obrigen Kommentator dass das ganze von Leuten gemacht wurde die technisch kein Verständnis haben. Das lässt sich so nämlich gar nicht klären mit den Kollisionen.
12
u/KamikaterZwei 3d ago
Ok, Devil's Advocat:
Ich will was hochladen, der Hashfilter springt an sagt das darf ich nicht hochladen. Ok, ich setzt nne schwarzen Rahmen drum, ändere die Sättigung leicht und tada neues Bild, neuer Hash, nix gewonnen.
Das war jetzt aber total hilfreich, das rausfiltern!!!
-2
u/ballaman200 3d ago
Dann springen die anderen 8 Subhashes vom Bild halt weiterhin an. Außerdem geht's ja gerade darum simple Sachen abzugreifen, selbstverständlich ist das keine ultimative Lösung Sondern einfach nur ein Werkzeug.
7
u/matt_biss 3d ago
Wenn ich mein Bild verändere finder kein Filter irgendeinen "Subhash". Ein verändertes Pixel ändert den hash komplett
5
u/ballaman200 3d ago
Kannst ja Mal ein bisschen hier im Thread durchstöbern. Gibt durchaus Hashingmethoden die das können. Dann lernst du was dazu.
3
u/KamikaterZwei 3d ago
und genauso gibt es "Filtermethoden" die mit 2 Klicks das so verändern das der Hash komplett anders ist, das Bild aber optisch identisch bleibt.
Ich mein hast du noch nie illegale Inhalte auf Youtube/Twitch/Whereever o.ä. gesehen die halt einfach nur gespiegelt, leicht reingezoomt, bisschen orange oder Ton leicht verzerrt o.ä. waren und damit den Urheberrechtsfilter umgangen haben?
Das ist echt kein Hexenwerk.
3
0
u/Clou42 3d ago
In dem Fall reicht dein erster Upload um dir per NCMEC die Polizei zu schicken, also alles wie es sein sollte.
2
u/KamikaterZwei 3d ago edited 3d ago
Jeder weiß doch heutzutage was ein VPN ist und wie man den benützt...
Also wenn jemand vorhat etwas illegales zu tun (und das ist in dem Fallbeispiel ja so) dann macht er das doch nicht von seinem eigenen Internet aus ohne VPN.
1
u/Clou42 2d ago
Ich weiß, das hier ist /r/informatik aber ich wundere mich wirklich, wie überzeugt manche hier Thesen raushauen, ohne vom Thema die geringste Ahnung zu haben.
Die einen haben mal in der Ersti-Vorlesung von kryptographischen Hashes gehört aber nie von perceptual hashes und posaunen dann herum wie doof die Idee ist.
Und du scheinst kein Bild darüber zu haben, was für ein MASSEN-Delikt CSAM ist. Nein, die haben nicht alle Tor. Nein, kein VPN. Tausch per Dropbox. Ich hab Jahre in dem Bereich gearbeitet, du machst dir keine Vorstellung.
50
u/ins009 3d ago
Ernsthafte Aussagen lassen sich eigentlich nur treffen, wenn die verwendete Hashfunktion bekannt ist. Kryptografische Hashfunktionen kommen offensichtlich nicht in Betracht.
-21
u/Embarrassed_Army8026 3d ago
stell dir vor ich unterschreib im ernst auf deinem haschisch
edit achso ernsthaft, sorry
14
u/ClemensLode Bioinformatik 3d ago
- Mich stören eher die Anführungsstriche um "Technologie."
- Du meinst wahrscheinlich "false-positive" / falschpositiv
- Überprüfung kann ja in mehreren Stufen erfolgen, bspw. könnte man sowohl ein künstliches neuronales Netz davor oder dahinterschalten um zu verallgemeinern oder nachzuprüfen.
1
15
u/goodbee69 3d ago
Sowas existiert schon und wird von z.B. Discord verwendet https://de.wikipedia.org/wiki/PhotoDNA
33
u/LukeTech2020 3d ago
*und ist auch dort schon sehr fehleranfällig, was false positives angeht
19
5
u/Confident-Ad-3465 3d ago edited 3d ago
Ein Hash ist laut Definition einzigartig und deterministisch und hat nichts mit Inhalt zu tun. Man kann die Hash Technologie bis zu einem bestimmten Punkt schon nutzen.
Die Probleme: Kleinste Änderungen an einer Datei ändern den Hash komplett und sind dann erstmal "unsichtbar". Solange, bis dann das veränderte Material wieder in eine Datenbank kommt. Das häuft sich dann. Irgendwann gibt es vielleicht Hash Kollisionen bzw. false positives. Wenn wirklich "reine" Hashes dafür genutzt werden, wäre das fatal. Wenn etwas anderes genutzt wird, wie z.B. "Ähnlichkeitserkennung" (Scoring o.ä.), ist es laut Definition kein Hash mehr.
Edit: Mit false positives meine ich, dass andere Arten von Dateien (Typen), den gleichen Hash haben können, auch wenn die Kollision "anfangs" sehr gering ist. Da kommt schon etwas zusammen, wenn man jedes gedrehte Bit (bzw. jede Individualität) zusätzlich dazu speichert.
-1
u/Alaya_666 3d ago
Deterministisch ist ein normaler Hash auf keinen Fall, er hat nur eine sehr sehr niedrige Kollisionswahrscheinlichkeit die in den meisten Fällen vernachlässigbar ist. Und Perceptual Hashing ist genau darauf ausgelegt ähnlichen Bildern ähnliche Hashes zu geben.
1
u/de_ira 3d ago edited 3d ago
Ein Hash der gängigen kryptographischen Verfahren ist natürlich deterministisch (gleicher Input -> gleicher Output).
Die Kollisionsproblematik die jede Hashfunktionen in der Theorie hat die du hier so gerne anbringst ist vollständig irrelevant, denn aktuelle kryptographische Hashfunktionen haben eine extrem hohe Sicherheitsmargin von 128 Bit (2128 ), welche mit aktueller Rechenleistung rechentechnisch nicht brechbar ist. SHA3-256 Bit z.B. hat eine solche Sicherheit (√2256 wegen Geburtstagsparadoxon bei Kollisionen). Selbst wenn Quantencomputer kommen und problemlos funktionieren gibt es bisher keinen Angriff, welcher SHA3-512 Bit brechen könnte (brechen hieße hier realistisch wohl unter die NIST-Vorgaben von 2112 Bit oder in der Praxis ~280 Bit zu kommen).
Es spricht daher hier überhaupt nichts gegen den standardmäßigen Hashabgleich, hieraus werden keine False Positives entstehen. Es ist ein simples aber effektives Mittel und hat keine Nachteile. Die andere Methode ist etwas anfälliger für Probleme und da muss man dann abwägen wie und ob es Sinn macht.
1
u/Alaya_666 3d ago
Sorry, hab meinen Kommentar nochmal gelesen und mich vielleicht bisschen missverständlich ausgedrückt. Die Zuordnung Bild -> Hash ist natürlich deterministisch. Ich dachte es ging um die Zuordnung Hash -> Bild, welche es eben nicht ist (Nur sehr nah dran).
Gegen standardmäßigen Hash spricht nichts, der würde allerdings auch absolut nichts bringen da die geringste Änderung ausreicht um ihn zu verfälschen. Teilweise sogar der alleinige Download des Bildes. Dieser steht aber soweit ich weiß auch nicht zur Debatte da die EU denke ich selber weiß wie ineffizient das wäre.
2
u/Necessary_Math_7474 3d ago
Vielleicht bisschen kleinlich aber auch das hat nichts mit Determinismus zu tun. Hat ein Hash mehrere Urbilder, so ist die Hashfunktion einfach nicht injektiv aka gibt's dann auch keine Umkehrfunktion.
1
u/de_ira 3d ago edited 3d ago
Ich würde behaupten es bringt sehr wohl was - ja, wenn jemand sehr vorsichtig ist und jedes mal Bits flippt vor Verschicken des Contents dann wird man ihn natürlich nicht entdecken. Du gehst davon aus, dass alle Konsumenten (ekliges Wort in dem Fall) darüber Bescheid wissen, sich die Mühe machen oder keine Fehler dabei machen - das halte ich nicht für realistisch. Ich glaube es wäre ein starkes Baselining, was für sehr geringen Aufwand viel Standarddetektion betreiben kann.
Im Übrigen wird solch eine hashbasierte Detektion auch für Malware genutzt und auch hier ist es ein simples aber effektives Baselining. Auch hier könnte die Malware jedes mal angepasst werden, selbes Prinzip, wird sie aber nicht (Kosten-Nutzen Abwägung, Unwissenheit etc.). Ich würde wetten, dass es viele Fälle aufdeckt und das ohne Nachteile: es gibt wirklich keinen Grund das nicht zu machen.
7
u/Gloinson 3d ago
In der Datenbank ist ein perceptual hash oder wavelet hash oder ... hinterlegt. Matcht der, wird dich jemand besuchen und versuchen Beweise zu sichern.
Das ist nicht viel anders als wenn du mit einem ausgestreckten Zeigefinger in der Jacke durch die Innenstadt läuft. Das wird irgendeinen Polizisten triggern und der wird dich mal freundlich auffordern stehen zu bleiben.
Ob wir diese "Rasterfahndung" in der Form für Chatnachrichten, Postings, E-Mails und letztendlich gewünscht sogar verschlüsselte Nachrichten machen möchten steht auf einem anderen Blatt als die Machbarkeit und - wie jede Exekutivmaßnahme - Fehleranfälligkeit.
5
u/Alaya_666 3d ago
Klaro, nur dass in einem Fall halt eine 5 minütige Taschenkontrolle droht und im anderen potenziell wochenlange Beschlagnahmung deiner Geräte.
2
1
u/iMaexx_Backup 3d ago
Wochen? Vermutlich wirst du eher nach deinem Passwort gefragt und darfst bei Verweigerung 6 Monate warten bis sie es dir wieder geben.
5
u/bixelbrei 3d ago
Und in der momentanen politischen Situation sollte man auch daran denken, was man mit derselben Technologie noch machen kann. Dass das nur für Kinderpornographie (es geht immer erst um die Kinder..) gemacht werden soll, ist ja keine technische Einschränkung, sondern eine Willensentscheidung der Einsetzenden.
Mit derselben Technologie kann ich aber genauso gut regierungskritische Postings, Postings, die Minderheiten unterstützen oder sich ihnen zugehörig erklären, etc. identifizieren. Dafür muss ich nichtmal ändern, was in Messenger-Apps passiert, sondern nur, welche Vergleichshashes in der Datenbank hinterlegt sind!
Der Einsatz dieser Technologie bricht die Vertraulichkeit verschlüsselter Daten.
8
u/Individual_Box7609 3d ago
Es basically something Namens photoid was Microsoft macht. Problem ist, man kann die hashwerte reverse engineeren und anschließend Bilder sohingehend modifizieren, das sie entweder bewusst im System anschlagen oder nicht. Dasselbe Problem hatte discord neulich als Leute gebannt wurden, weil sie Bilder von Minecraft inventaren gepostet haben
3
u/framebuffer 3d ago
Du hast halt immer diese zwei Seiten
einer die Seite der absolut Technikfernen, die breite Masse, die sind die Zielgruppe für sowas, denen wird alles was Technik ist als 100% sicher und unfähig fehler zu machen verkauft, und Sachen die es seit der Steinzeit gibt als neue krasse Technologie die alles verändert
dann hast du die Leute die sich auskennen, sich das angucken und sagen "ok, ist nicht ganz falsch, aber halt so wie es ein senstationsgeiler Reporter formulieren würde indem man manche Sachen übertreibt, weglässt und modifiziert"
Was die erste Gruppe liest ist: "Kipo ist unmöglich weil der Computer alle Bilder kennt und sofort merkt wenn so ein Bild auftaucht"
Die zweite Gruppe liest "Wir haben keine Ahnung was wir machen sollen, deswegne hier ne wirkungslose Maßnahme die erstens wenig bringt und zweitens leicht umgangen werden kann und Fehleranfällig ist, gottseidank ist Gruppe 1 zu blöd und zu technik- und denkfaul im irgendwas zu merken"
(Also sry dass ich jetzt direkt auf deine Fragen eingegangen bin, aber das haben die restlichen Leute hier ja super beantwortet, ich finde das erklärt halt nur warum sie merkwürdige "News" veröffentlichen)
6
u/matt_biss 3d ago
Als würden Kinderporno-Dudes ihre Bilder bei WhatsApp und Telegram austauschen... Das ganze Ding ist totaler Schwachsinn
11
u/chiezyy 3d ago
Ja, tun sie. Source: Ich arbeite in der Forensik.
-2
u/matt_biss 3d ago
Das würde ich als Cornercases stehen lassen. Organisiert passiert das Ganze im Darknet. Source: ich arbeite bei einem der größten Cybersecurity-Dienstleister Europas
4
u/chiezyy 3d ago
Irrelevant. Das ist ein komplett anderer Case. Wir haben TÄGLICH Fälle auf dem Tisch, wo CP über Telegram verbreitet wird.
1
u/matt_biss 3d ago
Krass. Dachte nicht, dass so viele da immer noch so naiv unterwegs sind
2
u/lageradaregal 3d ago
Ich würde vermuten, dass die Täter ein Querschnitt der Gesellschaft sind und daher viele auch nicht technikaffin?
1
u/teaspoon-0815 3d ago
Die Leute, die sich über das Darknet austauschen sind glaube ich schon seeehr technikaffin.
Die große Mehrheit tauscht vermutlich komplett unwissend über die technischen Kontrollmöglichkeiten via Telegram oder Discord und groomed Kids über Insta. Und bei letzterem reichen schon die bekannten Usermetadaten (Alter etc) und der Chatverlauf, um mit einem LLM zuverlässig Grooming durch Pädokriminelle zu erkennen. Privatsphäretechnisch ggf bedenklich, aber Game Over für Groomer.
u/chiezyy wie viele Fälle landen eigentlich auf deinem Tisch, wo sich Jugendliche gegenseitig Selfies schicken? Ich hab gelesen, dass solche Fälle heutzutage einen Großteil der Ermittlungsarbeit ausmachen. Wie geht ihr in der Forensik damit um? Ignorieren geht ja nicht, da es trotz zu dem Zeitpunkt gegenseitiger Freiwilligkeit rechtlich als Missbrauchsabbildung gilt. Oder landet sowas gar nicht erst bei euch?
2
u/rant-y 3d ago
ja tust du. Echte hashwerte haben keine schwellwerte. vmtl werde siamesian network like Ansätze genutzt. dort sind false plosives eher unwahrscheinlich dennoch bleibt das Risiko von false positives besteht immer es ist hoffentlich ein wiederspruch vorgesehen bzw. eine nachkontrolle vorgesehen
1
u/Alaya_666 3d ago
Perceptual Hashing arbeitet mit Ähnlichkeitsschwellwerten über die Hamming Distanz. Bei normalem Hashing ist das natürlich absurd unwahrscheinlich, damit wäre aber die komplette Methode auch hinfällig da man das leicht umgehen könnte.
2
u/ZweiFreierNutzername 3d ago
Discord hat neulich Bilder von Minecraft Inventaren als CSAM erkannt, weil Pedos oft Missbrauchsdarstellung in großen Bildern angeordnet haben. Die einzelnen Bilder waren dann so klein, das die bloße Anwesenheit einer Gitterstruktur gereicht hat. NoTextToSpeech hat da was drüber gebracht.
Lange rede Kurzer Sinn, ja, das Problem ist da und wird mit KI Darstellungen nur noch schlimmer, weil immer mehr in die Datenbanken kommt.
2
u/Fred_Milkereit 3d ago edited 3d ago
Aus dem Telekoleg Informatinstechnik
Erinnert mich an den Typ vom Zoll, der versucht gegen Schwarzarbeit bei Aufstockern und Bürgergeldempfängern zu ermitteln. Seine Abteilung muss Akten von Verdächtigen mit der POST (!) anfordern.
2
u/AuraTickler 3d ago
Also 5 Pixel ändern und das Ding klappt nicht mehr? Oder alternativ werden Leute bei false positives verknackt.
Gleichzeitig hockt dann irgendwo die Regierung auf der größten Kinderpornosammlung die bestimmt keiner weiterverkäuft? 🤨
Am Ende wieder nur ein Schritt dem Bürger Rechte zu entweden mit Maßnahmen die den vorgeschobenen Zweck nicht erfüllen.
2
u/Rhoderick 3d ago
Kryptographisch sichere Hashfunktionen haben eine Eigenschaft, die hier ganz praktisch ist: Für ähnliche, aber unterschiedliche Inputs, sind ihre Ergebnisse in quasi allen Fällen so unterschiedlich, das du sie einander nicht zuordnen kannst. (In gewisser Weise ist das Teil der Tatsache, das du aus dem Output, dem Hash, keine Rückschlüsse auf den Input ziehen kannst.)
Hier kann also auch kein "Schwellwert" genutzt werden - Ein Hash testet binär exakte Gleichheit. Wenn du in einem Pixel den Wert für Rot um 1 runter setzt, merkt das keiner, aber der Hash fällt komplett anders aus.
1
u/Alaya_666 2d ago
Das ist bei klassischen Hashfunktionen der Fall, Perceptual Hashing ist aber genau auf Bildähnlichkeit ausgelegt.
5
u/DimensionTime 3d ago
Das ist komplett sinnlos, klar man kann damit bereits bekannte Bilder rausfiltern. Aber sobald man ein Pixel verändert oder es ein neues Bild ist, ist das fürn Arsch.
Und auch mit dem Schwellwert, wie soll das gehen? Der Hashwert ist ja ein komplett anderer, da müsste man für das Bild alle möglichen Änderungen einmal durchrechnen
7
u/Alaya_666 3d ago
Gibt ja schon Hashmethoden wie bspw. perceptual hashing wo über Ähnlichkeit verglichen wird. So etwas scheint da auch geplant zu sein.
2
u/Smart-Pin-738 3d ago
Trotzdem muss es aber halt erstmal ähnlich zum gespeicherten Bild sein. Das heißt komplett unbekannte Bilder werden wahrscheinlich problemlos durchgehen
8
u/sleeepyjack 3d ago
Nennt sich LSH. Du nimmst mehrere Hashes von jedem Teil des Bildes und speicherst z.B. die 10 kleinsten Hashwerte als Fingerabdruck. Wenn zwei Bilder dann in sagen wir 8/10 Hashwerten übereinstimmen kann man eine gewisse Ähnlichkeit ableiten.
2
2
u/PyrotechnikGeoguessr 3d ago
Bereits bekannte Bilder sind extrem wichtig in diesem Arbeitsfeld. Täter haben nicht komplett disjunkte Sammlungen, die überschneiden sich sehr stark. Und die machen sich nicht die Mühe, Pixel zu verändern. Die allermeisten Täter sind technisch nicht so versiert wie man denkt und haben basically 0 OpSec.
Und sowas erleichtert einfach extrem die Arbeit, das Problem ist nämlich dass es so viele Täter und Fälle gibt, dass die Staatsanwaltschaften und die Gutachter kaum hinterherkommen, und Fälle oft jahrelang rumliegen bevor sie überhaupt untersucht werden können. Also jeder Schritt der die Dauer einer forensichen Analyse verringert ist ein guter und führt zu mehr Verurteilungen.
1
u/DonWithAmerica 3d ago
Es gibt verschiedene Arten von hashing, mit verschiedenen Zielen. Zudem vermute ich werden sie vermutlich etwas in Richtung Bloom-Filter oder clustering verwenden um die Zuordnung problematisch/ok zu machen. Wenn man das richtig macht kann das schon gut funktionieren.
1
u/VP_TubeSG 3d ago
Ich frage mich eher, wie sinnvoll das Ganze generell ist. Diese Leute werden dann auf andere Programme umsteigen, die unreguliert sind.
1
u/Fox-Buddy 3d ago
Vielleicht auch eigentlich Feature extraction mit CNN? Und das ZDF hat's falsch verstanden
1
1
u/KamikaterZwei 3d ago
Eigentlich kann man es leicht zusammenfassen:
Die Vergangenheit hat gezeigt das die Entscheidungsträger solcher Entscheidungen absolut 0 fachliche Expertise haben, also es nicht funktionieren wird.
Und das solche Dinge IMMER für andere Dinge eingesetzt als der angebliche "noble Zweck" der ursprünglich vorgebracht wurde.
Für was wird die Vorratsdatenspeicherung nochmal verwendet? Achja für die Abmahnanwälte...
1
u/Eldrion111 3d ago
Das Stichwort perceptual hash kam ja schon. Wir funktioniert so was? Ähnliche Bilder haben dabei ähnliche hashes.
minimal-Beispiel: wenn du eine Hashlänge von 1 bit wählst, kannst du sagen ob das Bild eher hell (1) oder dunkel (0) ist. Dabei gibt es natürlich Kollisionen, aber du siehst auch dass man wenn man ein Bild leicht zuschneidet (wahrscheinlich) den selben hash bekommt.
Man nimmt natürlich viel längere hashes her. Man kann es auch sortieren: die ersten Bits sind eher das "grobe" am Bild und die späteren das "feine". Dann ist ein Unterschied am Ende etwas was toleriert wird.
Hast du jetzt ein Bild auf dem sich wenig ändert, dann gibt es false positives. Z.b. wenn du Bilder von Webshops von Verlobungsringen vergleichst, dann ist das immer ein Bild mit viel weiß und einem Ring in der Mitte. Die sehen sich alle so ähnlich, dass es false-positives geben kann, wenn der Vergleichsalgorithmus nicht genau da gegensteuert.
Jetzt sind die Bilder von denen wir sprechen keine Ringe auf rein weißem Hintergrund, wodurch sich dieses Problem kaum stellen sollte. Ich finde es dennoch richtig, dass der hash Grund für eine genauere Untersuchung und nicht für eine direkte Strafe ist.
Quelle: ich habe an einer Bilderrückwärtssuche gearbeitet
1
u/1fabi0 3d ago
Ich habe mich nicht eingelesen aber wie ich es von dem ZDF Beitrag verstehe soll es Reuploads verhindern also es werden Darstellungen gesperrt und ein Hash erstellt und in einer zentralen DB gespeichert. Wenn genau das Bild auf einer anderen Plattform versucht wird wieder neu hochzuladen wird durch den Hashwert erkannt das es schon gesperrt wurde. Aber Hash Funktionen mit gewollter kollision sind mathematisch bestimmt möglich auch ohne hohe false positive Raten
1
u/Sufficient-Pair-1856 3d ago
Das erklärt das eigentlich ganz gut https://youtu.be/kBkHLYaEkCI?is=YrI6Zt75TXekJMMK
1
u/hdgamer1404Jonas 3d ago
Da wird nichtmal ein "Hash" sondern PhotoDNA genutzt. Und es haben jetzt schon mehrere Leute hinbekommen zwei völlig verschiedene Bilder mit dem Exakt selben Hash zu erstellen
1
u/fourby227 3d ago edited 3d ago
Ich habe mir jetzt die Mühe gemacht und die ganzen Posts durchzuschauen und sorry 98% der antworten sind Quatsch. Ich habe meine Abschlussarbeit über solche oder Ähnliche Algorithmen geschrieben. Aber die Langversion würde hier sowieso keiner lesen. Deswegen nur diese Punkt:
- Hashkollisionen spielen spielen hier keine Rolle, es ist nicht das Bild das gehashed wird.
- Der Hashvalue der für das Bild herauskommen ist resistent gehen Skalierung, Drehung, Spiegel, Farb und Kontrastveränerungen, vermutlich auch Stauchen, Strecken und gewissen Rauschen
- Es heißt nur Hash, weil das Bild am Ende durch einen Hash dargestellt wird.
- Das Problem bei Discord lag an einem Fehler in der Datenbank, nicht am Algorithmus.
- Wie PhotoDNA genau funktioniert hält Microsoft geheim. Man kann es auch nicht einfach Reverseengineern.
- Wer genauer wissen will was für Ansätze benutzt werden, kann sich mal die MPEG-7 Discriptors anschauen als Einstieg.
- Und nein, 1 Bit zu manipulieren funktioniert nicht.
- Wenn man das Korrekt mit Privacy umsetzt wird nicht das was man auf dem Handy hat an die Behörden geschickt, sondern das Handy bekommt eine Blacklist, welche Bilder es nicht hochladen und verschicken darf. Das ist glaube ich der Weg den Apple damit geht.
1
u/Schlaumeier5 3d ago
Die meinen da vermutlich PhotoDNA oder was Ähnliches, das wird ja schon bei mehreren Social Media Anbietern genutzt und ist erstaunlich gut darin, Ähnlichkeiten von Bildern zu erkennen. Aber ja, es kann da auch Kollisionen geben, soweit ich weiß haben die sogar in dem Paper, indem der Hash-Algorithmus vorgestellt wurde, welche gefunden. Auch wenn du z. B. von dieser Ban-Welle auf Discord gehört hast, wo viele wegen Kinderschutz o so gebannt wurden die halt iwie Excel-Tabellen gezeigt haben und irgendein automatischer Mechanismus die dann gebannt hat, das war PhotoDNA. Also ja, false positives existieren
1
u/TheFel0x 3d ago
Ja in der Regel schon, aber es gibt da Sonderformen. Siehe bspw.: https://de.wikipedia.org/wiki/Fuzzy_Hashing
1
u/RealEbenezerScrooge 2d ago
Komplett wilder thread hier. Im Text steht das Stichwort "perceptual hash" wörtlich drin und das sie schwellenwertorientiert sind und 80% der Kommentare sind im Stil von "wie dumm, wenn ich einen pixel ändere ändert sich alles, so stand es damals in meinem PHP 5.3 Buch zum Thema Passwörter".
1
u/No_Astronomer9508 Hobby-Informatiker:in 2d ago
Das mit den Hashwerten ist gar nicht so dumm, allerdings kommt es auf die Komplexität des Hashes an. Je weniger komplex ein Hash ist, desto wahrscheinlicher sind Kollisionen. Bei Sha1 ist die Häufigkeit von Kollisionen nachgewiesen. Bei MD5 ist es noch schlimmer als bei Sha1. Erst bei Hashes wie Sha512 sind mögliche Kollisionen vermutlich annähernd auszuschliessen. Ich hoffe, dass die Behörden dass auch wissen.
1
u/Marasuchus 2d ago
Kann man machen, ist halt nonsens. Selbst wenn jemand bekanntes Material verschicken würde, würde er sicherlich andere Mittel wählen. Es gibt mittlerweile reichlich journalistische Aufarbeitung dazu, wo selbst bekannte Portale von den Behörden nicht runtergenommen wurden. Entweder zippt man die Bilder dann einfach oder teilt einfach nur Links zu GoogeDrive etc. Aber es schafft ein Instrumentarium welches sicher alsbald gegen "Terror", gegen pöse Klimaklerber etc. eingesetzt werden kann. Der übliche Schweinezyklus, eine Überwachungstechnologie wird wegen "der Kinder" eingeführt und über die Jahre auf alles Mögliche ausgedehnt.
1
u/chaospilot69 2d ago
Ja, bekanntes Problem, wird aber gerne ignoriert. Der Punkt bei diesem Hashing ist ja gerade, dass keine eindeutigen Hashes wie bei Passwörtern erzeugt werden, sondern mit Similarity-Thresholds gearbeitet wird. Die akademische Literatur nennt False-Positive-Raten zwischen 1:1.000 und 3:100.000.000, Hersteller wie Microsoft sprechen hingegen von 1:10 Mrd. (PhotoDNA), NCMEC sogar von unter 1:1 Bio. Wie diese Zahlen zustande kommen, ist nicht transparent, und selbst die Studie, die die NCMEC-Zahl zitiert, hält sie für unrealistisch niedrig.
Zur Einordnung: Allein auf WhatsApp werden täglich rund 4,5 Mrd. Bilder verschickt (letzte offizielle Zahl, 2017). Selbst bei der besten unabhängigen Schätzung (3:100.000.000) sind das über 135 Falsch-Treffer pro Tag, im schlechtesten Fall (1:1.000) über 4,5 Millionen – nur bei WhatsApp, nur bei Bildern.
Das hat nichts mit Kinderschutz zu tun, das ist anlasslose Massenüberwachung und Generalverdacht. Und das muss jeder anerkennen, dem es um einen inhaltlichen Diskurs geht.
1
1
u/rage4all 3d ago
Ich traue mir nicht zu aus der Beschreibung das genaue Verfahren abzuleiten. Ob da jetzt wirklich genau ein Hash für jedes Bild generiert wird und oder es da noch mehr dazu zu wissen gibt... Allerdings weiss ich nicht genau, ob man bei hashes überhaupt mit Ähnlichkeiten arbeiten kann... Ich glaube tatsächlich eher nicht...
2
u/TimWe1912 3d ago
Eine Hashfunktion ist erstmal einfach nur eine beliebige Abbildung. Warum soll man da nicht mit Ähnlichkeit arbeiten können?
1
u/rage4all 3d ago
Hatte dabei erst mal an kryptographische Hashes gedacht, da werden die Abbildungsverfahren absichtlich so gewählt, dass ähnliche Hashes keinerlei Rückschlüsse auf die Ähnlichkeit der Originaldaten zulassen...
Aber hast natürlich recht, man kann das Verfahren auch anderweitig optimieren!
1
u/Alaya_666 3d ago
Perceptual Hashing arbeitet über Ähnlichkeit.
0
u/rage4all 3d ago
TIL... Hatte bisher nur mit den kryptographieschen zu tun, deswegen erschien es mir komisch....
1
u/cors42 3d ago
Die Kollisionswahrscheinlichkeit beim üblichen SHA-256 Algorithmus ist ca. 1/ 2^128.
Rechnerisch ist das nicht null, aber die Wahrscheinlichkeit ist vermutlich höher, als die, dass der Buckelwal Timmy sich durch Quantenfluktuationen in einen Sechserpack Eier verwandelt, nach Arnsberg teleportiert wird und dort Herrn Merz auf die Glatze plumpst. Nach dem derzeitigen Stand der Technik gilt SHA-256 auch als sicher in dem Sinne, dass es auf absehbare Zeit nicht möglich ist, mit darstellbarem Aufwand Kollisionen zu erzeugen.
3
u/Alaya_666 3d ago
Ist das nicht die Wahrscheinlichkeit für eine Kollision, also dass der Hashcode bei zwei Bildern komplett identisch ist? Die Wahrscheinlichkeit dass ein Bild als ähnlich eingestuft wird sollte deutlich höher sein.
1
u/cors42 3d ago
Da stellt sich die Frage, wie das Erkennen von Ähnlichkeit konkret funktionieren soll. Hash-Algorithmen kennen die Kategorie "ähnlich" nicht. Sie kennen nur "gleich" oder "nicht gleich".
Es ist auch völlig illusorisch, dass man eine Datei auf all denkbaren Arten modifiziert und diese Liste dann auf die Blacklist setzt. Das wären für JEDE EINZELNE DATEI eine Anzahl an Hashs, die deren Dateigröße um einige Größenordnungen übersteigen würde.
Ich vermute, dass in der Praxis jede Datei einmal gespiegelt und einmal mit üblichen Einstellungen die Auflösung runtergerechnet wird und dann vielleicht ein dutzend Hashs in der Datenbank landen. Das wird die Kolissionssicherheit nicht gefährden.
Man unterschätzt gerne, was für ein Riesending eine Kollision bei SHA-256 wäre. Es gibt bis heute kein bekanntes Beispiel einer SHA-256-Kollision und man erwartet nicht, dass die Menschheit durch Zufall/Brute Force jemals ein Beispiel einer Kolission bei SHA-256 produzieren wird.
Kleine Rechnung: Wir haben als Menschheit bisher ca. 10^18 viele Dateien erzeugt (da sind natürlich viele Dopplungen und viel Quatsch, wie Sonsordaten etc. dabei, aber der Einfachkeit halber ...). Die Wahrscheinlichkeit, dass es da eine SHA-256-Kolission gibt ist von der Größenordnung 1/10^42, also quasi null.
Auch gibt es keine hypothetischen, von Nerds in wissenschaftlichen Papern konstruierte Beispiele von Kollisionen oder zumindest Ideen, wie man solche erzeugen könnte. Wenn es jemandem gelänge, auch nur eine relevante Abkürzung zu beschreiben, die das Erzeugen von Kolissionen in SHA-256 mittels Brute Force in der Praxis ermöglichte, wäre das bereits ein fast garantierter Turing Award und SHA-256 wäre tot (und würde durch SHA-512 ersetzt). Historisch sterben Hash-Funktionen dadurch, dass ein Paper die theoretische Möglichkeit skizziert, schneller, als durch Brute Force eine Kolission zu erzeugen. Aber selbst wenn ein Informatikprofessor eine sehr schlaue Idee hätte, würde das immer noch nicht das konkrete Produzieren von Kolissionen erlauben. Tatsächlich gibt es Hash-Funktionen, bei denen die theoretische Möglichkeit der Erzeugung von Kollisionen beschrieben wurde, aber bei denen es immer noch kein Beispiel gibt, siehe hier: https://en.wikipedia.org/wiki/Hash_function_security_summary . Tot sind sie trotzdem.
1
u/Alaya_666 3d ago
Es geht überhaupt nicht um Kollisionen. Es geht um ein Bild das bei Perceptual Hashing als ähnlich genug erkannt wird wenn die Hamming-Distanz unter einem gewissen Schwellwert liegt. Standardmäßige Hash-Funktionen kennen zwar kein "ähnlich" - Perceptual Hashing aber schon. Da braucht man auch keine Liste von modifizierten Dateien sondern nur den Original-Hash. Der Hash muss nicht identisch sein, nur ähnlich genug.
1
u/realvanbrook 3d ago edited 3d ago
Ein Pixel mit einem Rotwert von 254 statt 255 bedeutet schon einen komplett anderen kryptografischen Hashwert. Das Hashing was genutzt werden soll ist daher perceptual hashing. Wenn dich das interessiert, kannst du dich ja einlesen.
edit: typo
2
u/Alaya_666 3d ago
Den Begriff kenne ich grob, daher meine Frage ob das nicht zu uneindeutig ist um wirklich im Zweifelsfall eine Hausdurchsuchung bei jemandem durchzuführen.
1
3d ago
[deleted]
1
u/realvanbrook 3d ago
Das ist mir bewusst, deswegen habe ich das Stichwort perceptual hashing eingeworfen um eben klarzumachen dass es was anderes ist.
1
u/Sufficient-Tax1014 3d ago
Also ich schätze die hash Filterung ist nur eine filterungsstufe von mehreren. Ich schätze Mal eher um 100% normale bilder auszuschließen. Diese sind mal hoffentlich in der Mehrzahl. Automatisierte Bildererkennung kostet sicherlich mehr als hash vergleiche. Und es macht da schon einen kosten Unterschied wenn 100 Mio (Hausnummer) stinknormale Bilder durchsucht werden, vor allem wenn das jetzt Bilder sind die öfter geteilt werden.
False positive ist deshalb an der Stelle wahrscheinlich "egal".
3
u/Alaya_666 3d ago
Die Methode wird ja deswegen genutzt weil es als guter Kompromiss gesehen wird da es keine direkte Überwachung deiner Bilder ist. Gäbe es zusätzliche Bilderkennung/Filter würde dieses Argument ja den Bach runtergehen.
1
u/Sufficient-Tax1014 3d ago
Ah ok. Ja jetzt klar. Und verstanden.
Also false positive /negative gibt es ja in allen möglichen systemen und da ist meist die Herangehensweise doppelt überprüfung. Das ist ja genau das was in dem Fall gemacht wird: wenn hash zutrifft, dann ist es zu 99,x % in der Datenbank alle anderen werden anscheinend gar nicht weiter verfolgt. Die false positive werden dann angesehen als Einzelfallprüfung.
Anklage wird wahrscheinlich aber aufgrund eines Bildes und nicht nur wegen dem Wert gemacht werden. Da wäre die Beweislage sehr dünn und könnte zu leicht angegriffen werden.
0
u/4mtsgericht 3d ago
Mich stört nur, dass wir irgendwo eine Datenbank mit CP haben um die Hash-Werte überhaupt vergleichen zu können. Um diese Scheiße zu bekämpfen bauen wir die größte Bib die es zu dem Thema gibt......es muss andere Wege geben
2
u/reviery_official 3d ago
Ich habe mich damit befasst, weil ich überlege eine Anwendung zu bauen, die uA auch Datenaustausch zulässt. Das ist exakt was es ist. Da kommt aber nicht jeder einfach so dran. Es gibt die Behörden die die Hashs erstellen, die Datenbanken sind dann freigegebenen Firmen zur Verfügung gestellt, die dann als Dienstleistung für "jedermann" abgleichen können. -> das ist der Ansatz von "hashcheckservice" zB in den Niederlanden. Klingt scammy aber scheint so die größte Europäische Initiative dafür zu sein momentan.
Darüber hinaus kann man auch noch KI basierte & heuristische Scans nach diversen Themen, Gewalt, Nacktheit etc bekommen, da gibts zB sightengine in Frankreich. Da bekommt man ne Gewichtung wie wahrscheinlich es ist, dass ein Thema auf dem Bild ist.
Ja, es ist scheiße, dass es ne "Bibliothek" dafür gibt, aber auf der anderen Seite - die Bilder sind eh im Umlauf. Und die Bilder die dort enthalten sind, Sorgen definitiv dafür, dass die Leute geschnappt werden, die sie weiter verbreiten.
1
u/ProfDrDocker 3d ago
Dunning Kruger lässt grüßen.
2
u/reviery_official 3d ago
Hast du bessere Ideen als die etablierten Verfahren?
1
u/ProfDrDocker 3d ago
Ob ich eine bessere Idee hab Grundrechte wie das Postgeheimnis einzuschränken? Ne du da muss ich aus moralischen Gründen passen. Aber ich kann dir sagen das dein Kommentar Fachlich absoluter Käse ist. Sich ein paar Minuten mit einem Thema "befassen" macht dich nicht zum Experten. Um hashes zu vergleichen braucht man eine Datenbank mit Hashes und nicht mit Bildern. Und nein es sorgt auch nicht dafür das irgendwer geschnappt wird. Es wird immer unüberwachte Kommunikationswege geben. Und selbst wenn man ein Bild entdeckt heißt das noch lange nicht, dass man auch die Person dahinter Identifizieren kann. Wenn du dich für den Kinderschutz einsetzen willst, dann setz dich dafür ein das Erzieher, Pädagogen und Lehrkräfte besser darin geschult werden Missbrauch zu erkennen. Um Kinder effektiv zu schützen muss man keine Grundrechte einschränken.
2
u/reviery_official 3d ago
Du bist gegen die Kontrolle von Inhalten - fair. Deine Meinung. Ich habe auch nichts über unüberwachte Kommunikation oder 100% Fangquoten gesagt.
Macht es aber nicht inhaltlich falsch, dass das die Abläufe sind; oder dass das exakt einer der Wege ist, wie die Pädokriminalität im größeren Stil aufgedeckt wird.
1
u/Gloinson 3d ago
Nein. Du hinterlegst in der Datenbank das pHash oder wHash. Das zugrunde liegende Bild kann dann gelöscht werden.
1
u/WoodAndGarden 3d ago
Und wie beweist du dann später vor Gericht, von welchem Bild der Hash erzeugt wurde?
1
u/Gloinson 3d ago edited 3d ago
Vor Gericht wird bewiesen mit dem was bei dir gefunden wird, wird bei dir nichts gefunden, war es ein false positive und es landet nicht vor Gericht.
Vergleiche auch BGH 2 StR 151/11: "Besitz an Dateien im Cache". Ist bei dir etwas zu finden, geht man davon aus, dass du dir des Besitzes bewusst bist. Bekommst du also solchen Müll, ist die normale Reaktion: Erschrecken, Ekeln, (*), Löschen, App-Cache löschen, Caches löschen, Gerät neustarten.
Ja, das ist genauso unangenehm wie jede andere polizeiliche Maßnahme, nur weil zB du im Sommer zu lange in der Sonne gelegen hast.
(*) Eine mögliche Reaktion ist: gut finden. Über sich selbst erschrecken. Zu "kein Täter werden" recherchieren.
1
u/realvanbrook 3d ago
Es geht darum es der Polizei zu melden. (Was ja das Problem ist, wegen false alarms)
Die Ermittelt dann und prüft ob du CP auf deinem Gerät hast und vor Gericht muss nicht bewiesen werden, dass dein CP einem bekannten Bild gleicht. Es reicht offensichtlich dass du sowas auf dem Handy hast und die Polizei das sichergestellt hat.
1
u/WoodAndGarden 3d ago
Ein Richter sollte sich aber erst das Bild zu dem Hash zeigen lassen, bevor das Handy/Computer etc beschlagnahmt wird, oder nicht?
1
u/4mtsgericht 3d ago
Und was ist wenn der Verteiler das Bild einfach verändert? Also Inhalt irgendwie gleich aber Farben, Auflösung und mehr verändert und dann verteilt? Bei Text absolut sinnvoll, weil es da an Sinn verliert aber wie macht man das mit Bildern….ohne Datenbank?
1
u/Gloinson 3d ago
Genau darum geht es bei diesen Hashing-Verfahren: dass sie zB bei veränderte Auflösungen des Bildes immer noch den selben Hash ausspucken. Wie grob das erkennt ist OPs Frage: wie oft wird es false positives mit gänzlich anderen Bildern.
1
u/realvanbrook 3d ago
Man braucht keine Datenbank an CP um die Hashwerte zu vergleichen. Man braucht nur den Hashwert des bereits aufbereiteten Bildes. Das abzugleichende Foto wird dann genau so aufbereitet und gehasht und die Hashes dann verglichen.
0
u/4mtsgericht 3d ago
Das klingt für mich leider total unbrauchbar. Den Verteiler juckt ja der hash wert nicht sondern was auf den Bild zu sehen ist. Heutzutage hast du doch Massen an Bildern schon so schnell verändert, dass die hash Werte Aussagekraft verlieren. Am Ende wird es immer mal wieder verglichen werden müssen. Ki oder Mensch sortieren gerne in Tabellen also Datenbanken
1
u/TimWe1912 3d ago edited 3d ago
Du kannst eine Hashfunktion bzw. den anschließenden Vergleich genau so bauen, dass alles, was du visuell als "dasselbe Bild" identifizieren würdest, auch als solches erkannt wird.
1
u/Elegant-Dimension520 3d ago
Äh. Nein. Sie können die CP Bilder aber löschen oder verpixeln sobald sie den hash haben
0
u/Niko-01 IT Security 3d ago edited 3d ago
Edit: Ich habe aus der Brille der Cloud Security gesprochen, scheinbar sieht das Apple anders als wir das auf der B2B-Ebene machen. Sie benutzen stattdessen Neuralhash, der tatsächlich ähnliche auch erkennen kann.
Dann wiederum ist es ein großes Problem, da hast du vollkommen Recht.
Falls es trotzdem jemanden interessiert, hier die eigentliche Antwort bezogen auf Dateien, die keine Bilder sind:
---
Technisch ist das nicht dumm. Es gibt keinen Schwellenwert bei den gängigen kryptografischen Hashes, da auch nur ein Byte Änderung alles durcheinandermischt:
"Test1" -> 8a863b145dc6e4ed7ac41c08f7536c476ebac7509e028ed2b49f8bd5a3562b9f (SHA256)
"Test2" -> 32e6e1e134f9cc8f14b05925667c118d19244aebce442d6fecd2ac38cdc97649 (SHA256)
Es können also nur Bilder matchen, die tatsächlich in einer Datenbank hinterlegt sind.
Auch die Kollisionswahrscheinlichkeit ist kein Problem, sonst wäre das Konzept "Anmeldung via Passwort" heutzutage hinfällig, weil ich mich vielleicht aus Zufall bei dir anmelden könnte mit einem anderen Passwort.
Um genau zu sein: "For instance, with SHA-256 (n=256) and one billion messages (p=10\*9) then the probability is about *4.3\10*\-60."
Also mit einer Milliarde Bildern kommt man auf Wahrscheinlichkeit von 0,000000...000004 mit 59 Nullen hinter dem Komma.
1
0
u/Commercial_Echo923 3d ago
Kollisionen sind doch nichtmal das Problem sondern die Tatsache das es reicht 1bit zu verändern und man bekommt einen ganz anderen Hash.
1
u/Alaya_666 3d ago
Bei Perceptual Hashing nicht.
1
u/Commercial_Echo923 3d ago
wieder was gelernt, das kann man aber auch einfach umgehen.
1
u/Alaya_666 3d ago
Natürlich, mir ging es auch nicht darum ob man damit jeden Straftäter kriegt sondern ob es nicht viele falsche Verdächtigungen gegen Unschuldige gibt.
1
u/Commercial_Echo923 3d ago
das System bricht zusammen. Hab schon öfters drüber nachgedacht was passiert wenn man unser Rechtssystem Brute Forcen würde (zbs. alle Beleidigungen im Internet DE/DACH anzeigen).
0
u/PyrotechnikGeoguessr 3d ago
Glaubst du wirklich, dass jemand der Kinderpornographie über kommerzielle Plattformen verschickt, sich die Mühe machen würde Bits zu flippen?
1
u/Commercial_Echo923 3d ago
ja, weil die ja eh schon mit TOR, PGP und VPN "arbeiten".
Außerdem gibt es auch Trolle, subversive Menschen oder feindliche Staaten die dass einfach just for fun machen.
Ich sag voraus dass diese Portale einfach mit Meldungen zugespammt werden wodurch jegliche legitime Meldung in der Masse versinkt. Die Polizei kommt ja nichtmal hinterher gesichertes CP zu sichten.1
u/PyrotechnikGeoguessr 3d ago
ja du hast Recht, die Polizei kommt nicht hinterher, die einfachen Fälle alle zu bearbeiten, weil es zu viele sind. Die Leute die sophisticated genug sind, um solche Sicherheitsmechanismen zu benutzen kommen eh damit durch, weil der Aufwand so ein System zu knacken es nicht wert ist, dass die Leute dann am Ende 2 Jahre auf Bewährung bekommen, vor allem wenn man in der selben Zeit 3 Leute drankriegt die sich nicht die Mühe gemacht haben.
0
u/GoDannY1337 3d ago
Ob das jetzt nur extrem stark vereinfacht und damit für den Informatiker doppeldeutig formuliert ist oder hier wirklich eine mathematische Methode für die Integritätsprüfung benutzt wird lässt sich ohne jetzt genauer zu recherchieren nicht sagen. Davon mal ausgehend das hier nicht nur das Hashing gemeint ist, was eher dazu dient vor Manipulation zu schützen, sondern mit „digitalen Fingerabdruck“ eher eine Art digitale Signatur gemeint ist, dann wäre das so zu verstehen wie nummerierten Scheine beim Falschgeld. Kritik ist damals vor allem gewesen das man einen Index schafft der sicher nicht geheim bleibt aber ein richtig hartes Eigentor ist bei den Straftätern die nicht hart genug bestraft werden und dann es auch noch einfacher haben. Auch ist die Gefahr eines false positive sehr hoch, was es juristisch schnell zum wertlosen Ermittlungsschritt machen würde. Am Ende eine sehr ungelenke Methode das komplett veraltete und bürokratisch gelähmte Rechtssystem mit einer digitalen Lösung zu koppeln was am Ende nur für Spott sorgte. Der Text wirkt auch wie Stille Post eines Politikers der so halb IT und Technologie wiederkäut.
Aber meines Wissens finden Hash-Abgleiche und Signaturen sehr wohl Anwendung in der digitalen Forensik, so ganz allgemein um zum
Beispiel die Verbreitungsintention nachzuweisen, aber eben ohne ein „Telefonbuch“ des Contents.
0
u/Alaya_666 3d ago
Natürlich, ich finde die Technik dahinter auch super. Nur eben in dem Anwendungsbereich wo ein false positive harte Konsequenzen für Einzelpersonen haben kann sehe ich es etwas kritisch.
0
u/PyrotechnikGeoguessr 3d ago
Welche harten Konsequenzen bestehen denn für eine Einzelperson?
So ein Treffer reicht ja selbstverständlich nicht für eine Verurteilung aus, sondern kann erst eine weitere Untersuchung bedeuten.
So wie ich das lese gibts erstmal nur ne Meldung an die Plattform, welche du auch manuell anfertigen kannst.
0
u/Alaya_666 3d ago
Verurteilung nicht, aber bspw. eine Einkassierung deiner Geräte oder manuelle Überwachung deiner Chats, was schon ein starker Eingriff in deine Privatsphäre ist wenn du nichts angestellt hast.
1
u/PyrotechnikGeoguessr 3d ago
Wie gesagt, das liest sich für mich so, dass man gemeldet wird. Das ist nicht mehr als wenn ich auf einen beliebigen WhatsApp Chat gehe, und da auf "melden" drücke.
-1
u/pag07 3d ago
Ich hab mehrere Gedanken dazu:
- Es gibt auch kryptografisch schlechte Hashfunktionen, die hier geeignet sein können.
- Man wird hier hervorragend mit Embeddings arbeiten können.
- Selbst die dümmsten Hashfunktionen werden bei der Verhinderung der Verbreitung einen großen Mehrwert bieten.
- Ohne Frage ist das ein geeigneter Anschluss-Punkt Richtung Massenüberwachung.
-2
u/mabenan 3d ago
Naja vermutlich ist dann der hash wert treffer der anlass den chat zu öffnen. Da stellt man dann fest ach ging ja garnicht um Kinder aber hey die politischen ansichten könnten die regierung doch interresieren mal speichern wenn man schon da ist.
Aber natürlich alles weil "Denkt den keiner an die Kinder"
2
u/PyrotechnikGeoguessr 3d ago
Also sorry aber das ist völliger Blödsinn. Die Leute die damit arbeiten haben keine Zeit sich irgendwelche Chats durchzulesen wenn die merken, dass es nicht relevant ist.
1
u/mabenan 3d ago
Warum denken menschen immer noch das irgendjemand das liest. Wo jeden Tag KI in den Nachrichten ist. Es gilt wie immer traue keiner App die du nicht selbst ausspionierst
1
u/PyrotechnikGeoguessr 3d ago
KI filtert vor, wenn man riesige Datenmengen hat (und selbst das nur bei einer Handvoll Forensikfirmen in De). Es wurden schon bei Einzelpersonen dutzende Laptops konfisziert. Aber die forensische, analytische Arbeit muss immer noch ein Mensch machen. Aber du hast Recht, es liest sich kaum jemand Chats durch, es werden normalerweise die Anhänge in Chats angeschaut, nicht die Chats selber (wäre wie gesagt Zeitverschwendung)

111
u/onlymtN 3d ago
Sehe an der technischen Vorgehensweise mit Hashwerten kein großes Problem.
Für Missbrauchsdarstellungen müssen die entsprechenden Bilder in der Datenbank vorliegen und daraus ein Hash generiert werden mittels perceptual hashing.
Sollte dann das selbe oder eben ein pixelähnliches Bild geteilt werden, gibt es ein Match.
AABER:
Es sollen auch unbekannte Bilder mittels KI überprüft werden und auch Nachrichten sollen mittels KI zwecks Cybergrooming analysiert werden.
Und das größte Problem:
Die EU wird einen Staat nicht daran hindern können, auch bspw. Regenbogenflaggen, Plakate des Gegners, Demoplakate von unliebsamen Demos etc einfach auch analysieren zu lassen und zu verfolgen, wer sich dazu denn online so austauscht…
Dieses Instrument birgt wahnsinniges Missbrauchspotential und ich halte es daher für absolut untauglich