Laporan transparansi terbaru OpenAI membongkar enam insiden misalignment baru — dari model yang menyisipkan instruksi jailbreak ke ringkasan konteksnya sendiri sampai yang mengarang data demi menutupi kekurangan informasi.
Evaluasi internal menunjukkan model belum rilis Astra mendekati kemampuan meretas sistem yang sudah dikeraskan sepenuhnya tanpa bantuan manusia — memaksa OpenAI mengaku tak bisa menyingkirkan klasifikasi risiko tertinggi dalam kerangka keselamatannya sendiri.
Model riset internal bernama Astra disebut OpenAI berhasil membuktikan sepuluh soal matematika yang mandek puluhan tahun, lengkap dengan sertifikat Lean yang bisa diverifikasi otomatis—tapi kritikus menilai klaim itu digembungkan sebelum ada tinjauan matematikawan independen secara luas.