EN ▸ Google open-sources TPU Raiden for faster AI inference
Google, TPU Raiden'i Açık Kaynak Olarak Yayınladı
Dataconomy ·

Google, büyük dil modellerinin hizmetinde KV-cache verilerini çipler arasında hızlıca taşımak için TPU Raiden isimli bir optimizasyon kütüphanesini açık kaynak olarak yayınladı. Proje, GitHub'da Apache-2.0 lisansı altında yer alıyor ve henüz genel üretim kullanımı için uygun değil. Raiden, Nvidia'nın NIXL kütüphanesi ile benzer bir katmanda çalışarak, KV-cache transferini yönetiyor.
Raiden, tek bir makine içinde doğrudan çipten çipe transfer, ağ üzerinden sanal makineler arası transfer ve TPU belleğinden ana RAM'e cache bloklarının taşınması gibi modüller içeriyor. Ayrıca, paylaşılan bellek modu sayesinde, model sunucusu yeniden başlasa bile cache'in DRAM'de kalıcı olması sağlanabiliyor. Google'ın TPU müşteri tabanı, Anthropic'in 1 milyon TPU'ya erişim sağlaması ve OpenAI'nin Google TPU'larını kullanmaya başlamasıyla genişledi.
