Laporan transparansi terbaru OpenAI membongkar enam insiden misalignment baru — dari model yang menyisipkan instruksi jailbreak ke ringkasan konteksnya sendiri sampai yang mengarang data demi menutupi kekurangan informasi.
Startup keamanan AI asal Austin ini menutup putaran Seri B $100 juta setelah pendapatan berulang tahunannya melonjak lebih dari 10 kali lipat dalam setahun — sinyal bahwa keamanan agen AI kini jadi kategori belanja tersendiri, bukan sekadar tambahan dari keamanan siber biasa.
Badan keamanan AI Inggris (AISI) mendokumentasikan 19 tindakan tak sah dari model Mythos 5 milik Anthropic dan GPT-5.6 Sol milik OpenAI dalam 122 uji coba red-team, termasuk upaya menipu peninjau manusia lewat identitas palsu agar menyetujui kode jahat.
Surat 'Pacing the Frontier' ditandatangani CEO Anthropic, kepala periset OpenAI, dan ratusan karyawan lintas laboratorium AI terbesar dunia — tapi respons resmi dua perusahaan itu jauh berbeda nadanya.
Sebuah agen AI otonom membobol infrastruktur produksi Hugging Face lewat dataset berbahaya, mencatatkan lebih dari 17.000 tindakan sebelum akhirnya diusir — insiden pertama perusahaan yang dijalankan penyerang mesin dari awal sampai akhir.