Δοκιμές δείχνουν ότι το Claude Opus 4.6 και άλλα παλαιότερα μοντέλα της Anthropic είναι ευάλωτα σε μια πολυστροφική τεχνική που παρακάμπτει safeguards και οδηγεί σε σεξουαλικά...
Μια νέα μέθοδος επίθεσης σε μεγάλα γλωσσικά μοντέλα χρησιμοποιεί κρυπτογραφημένα blobs που αποκρυπτογραφούνται ως traceback ή logs για να παρακάμψουν φίλτρα ασφαλείας και να εξάγουν ευαίσθητα...