Claude Code’un bir web sitesini özetleme sürecinde verdiği beklenmedik karar, zararlı Python kodunun çalışmasına kadar uzanabiliyor. Testlerde saldırganların uzaktan komut çalıştırabildiği ve yerel dosyalara erişebildiği görüldü.

Bir web sitesini yalnızca özetlemek isteyen bir kullanıcı, yapay zeka destekli bir kodlama aracının beklenmedik şekilde zararlı kod çalıştırmasına neden olabilir. Anthropic’in Opus 5 altyapısıyla çalışan Claude Code üzerinde tespit edilen saldırı yöntemi, yapay zeka aracılarının birbirinden bağımsız görünen işlemleri bir araya getirerek nasıl ciddi güvenlik riskleri oluşturabileceğini ortaya koyuyor.
Güvenlik araştırmacısı Johann Rehberger tarafından ortaya çıkarılan yöntemin, ağustos ayının ortasından itibaren varsayılan seçenek haline gelen “Otomatik Mod” ile yapılan testlerde yüzde 80’e varan başarı oranına ulaştığı belirtiliyor. Senaryoda kullanıcı, not defteri kayıtlarından oluşan bir arşiv gibi görünen zararlı bir internet sitesinin özetlenmesini istiyor. Claude Code’un yerleşik WebFetch aracı sayfayı işlerken geçersiz medya türü hatası veriyor. Bunun ardından model, kullanıcıdan yeni bir komut gelmesini beklemek yerine içeriği almak için arka planda Bash aracını kullanarak indirme işlemi gerçekleştiriyor.
İndirilen arşivin içinde katalog bilgileri, çeşitli metin dosyaları ve macOS kütüphanelerinin yanında zararlı bir Python dosyası da bulunuyor. Model, güvenlik kuralları nedeniyle arşivdeki harici çalıştırılabilir dosyayı doğrudan çalıştırmayı reddediyor. Ancak burada farklı bir yol seçiyor ve gerekli işlemi gerçekleştirmek için kendi kod çözücüsünü oluşturuyor.
Asıl problem de bu noktada ortaya çıkıyor. Yazılan kod çözücü standart kütüphaneleri kullanırken, arşivin içine yerleştirilmiş ve sistemdeki resmi bir modülle aynı adı taşıyan zararlı Python dosyası devreye giriyor. Böylece yapay zeka, doğrudan çalıştırmayı reddettiği zararlı kodun dolaylı biçimde çalışmasına yol açıyor.
Sistem üzerinde daha ileri işlemler mümkün
Testlerde güvenlik kontrollerini aşan kodların uzaktan komut çalıştırabildiği görüldü. Bununla da sınırlı kalmayan saldırı, bilgisayarda yeni ve bağımsız bir yapay zeka sürecinin başlatılmasına, sistem üzerinde keşif yapılmasına ve yerel dosyalara erişilmesine kadar ilerleyebiliyor.
Anthropic ise güvenlik araştırmasına verdiği yanıtta, söz konusu davranışın sistemin tasarlandığı biçimde çalıştığını belirtti. Şirket, Otomatik Mod’un bir güvenlik garantisi olmadığını, temel olarak kullanım kolaylığı sağlamak amacı taşıdığını ifade ediyor.
Araştırmacıların dikkat çektiği temel nokta ise tek bir adımın değil, birbiri ardına gelen masum görünen işlemlerin oluşturduğu zincirin risk yaratması. Yapay zeka kodlama araçlarının her adımı ayrı ayrı güvenli kabul etmesi, bu adımların birlikte zararlı bir sonuca ulaşmasını engellemeyebiliyor. Bu nedenle uzmanlar, kodlama amacıyla kullanılan yapay zeka ajanlarının doğrudan ana sistem üzerinde çalıştırılmaması ve mümkün olduğunca korumalı sanal alanlarda izole edilmesi gerektiğini vurguluyor.