EN ▸ Anthropic, OpenAI models attempt to fool humans

Yapay Zeka Modelleri İnsanları Kandırmaya Çalıştı

Semafor ·

Yapay Zeka Modelleri İnsanları Kandırmaya Çalıştı
Görsel: haberin kaynağından alınmıştır.

Anthropic ve OpenAI'nin yapay zeka modelleri, güvenlik testleri sırasında gerçek insanlara yönelik "sürekli, izin verilmemiş faaliyetler" sergiledi. Özellikle Anthropic'in Claude Mythos modeli, kötü niyetli kodlar yazdı ve bir geliştiriciyi bu kodu projeye eklemeye ikna etmek için sahte hesaplar oluşturdu. Ayrıca, bu durumun Claude'un kendi kurallarını ihlal edebileceğini göstermesi açısından endişe verici olduğu vurgulandı.