21 Temmuz 2026 — Amazon Web Services (AWS), üretken yapay zekâda saniyeler içinde güvenilir yanıt üretimini hızlandırmak ve toplam maliyeti düşürmek için çıkarım (inference) altyapısında yeni geliştirmelerini tanıttı. Project Mantle ile akıllı yönlendirme sunulurken, yeni nesil Trainium3 çipleriyle zorlu iş yüklerinde %40’a varan maliyet tasarrufu hedefleniyor.
Üretken yapay zekânın ölçeklenmesiyle, çıkarım altyapısına yapılan yatırımlar eğitimden daha kritik hâle geldi. AWS; özel tasarım Trainium silikonunu, birleşik ağ mimarisini ve akıllı yönlendirme teknolojilerini tek bir tam katmanlı (full‑stack) yaklaşımda birleştirerek kurumsal yapay zekâyı daha hızlı, dayanıklı ve ekonomik kılıyor.
“Çıkarım, yeni bir bilgi işlem türü. Kendine has ölçeklendirme kalıpları, kısıtlamaları ve gereksinimleri var.”
İki saniyelik yanıtın arkasındaki teknik süreç
MIT Technology Review verilerine göre yapay zekâya ayrılan hesaplama gücünün %80–90’ını çıkarım oluşturuyor. Amazon Bedrock, iki saniyenin altında doğru yanıt üretebilmek için aşağıdaki dört aşamayı otomatikleştiriyor:
Adım 1: Tokenization (5–10 ms)
Kullanıcı girdisi anında belirteçlere (token) dönüştürülür ve makine tarafından okunabilir hâle getirilir.
Adım 2: Prefill (10–100 ms)
Model, bağlamı netleştirmek için komutu milyarlarca parametre üzerinde değerlendirir ve üretimi yönetecek anahtar‑değer önbelleği oluşturur.
Adım 3: Decode (100–1.000+ ms)
Yanıt, her seferinde tek bir belirteç üretilerek inşa edilir. Her belirteç geçmiş bağlamı kullanır; bu da hesaplama ve bellek bant genişliği talebini artırır.
Adım 4: Detokenization (son milisaniyeler)
Üretilen belirteçler akıcı bir şekilde yeniden insanlar tarafından okunabilir metne dönüştürülür ve arayüze iletilir.
“Üretken Yapay Zekâ” engelini aşmak
Modern yapay zekâ aracıları, tek bir görevi tamamlamak için birden çok modeli ve çok adımlı iş akışlarını koordine eder. Bu zincirin herhangi bir halkasındaki gecikme veya hata, kullanıcı deneyimini etkiler. Geleneksel bulut mimarileri, bu karmaşıklığın getirdiği artan maliyet, gecikme ve güvenilirlik risklerini yönetmekte yetersiz kalabilir.
Project Mantle: Yüksek performans için akıllı yönlendirme
Amazon Bedrock’ı optimize eden gelişmiş çıkarım motoru Project Mantle, dört temel yenilikle performansı yukarı taşıyor:
Akıllı Önceliklendirme: İş yüklerini öncelik seviyelerine göre eşleştirerek düşük gecikmeyi maliyet etkin biçimde korur.
Özel Kuyruğa Alma: Kullanım dalgalanmalarının diğer müşterileri etkilemesini önlemek için iş yüklerini izole eder.
Kesintisiz Kontrol Noktaları (Journal): Olası kesintilerde istek durumlarını otomatik kaydederek gereksiz yeniden işlemeyi engeller.
Birleşik Ağ Mimarisi: Makine öğrenimi ağlarını birleştirerek hata noktalarını azaltır ve yanıt sürelerini hızlandırır.
Özel silikonla maliyeti düşürmek: Trainium ve Trainium3
Kurumsal yapay zekânın sürdürülebilirliği, çıkarım başına maliyetin düşürülmesine bağlı. Amazon Bedrock’taki belirteç kullanımının büyük kısmı halihazırda AWS’in özel tasarım Trainium çiplerinde çalışıyor. Yeni nesil Trainium3 ise en zorlu iş yüklerinde bile %40’a varan maliyet tasarrufu sunması beklenen performans‑maliyet dengesiyle öne çıkıyor.
AWS, silikondan akıllı ağ protokollerine kadar yığının her katmanını optimize ederek kurumların yüksek kârlılığa sahip, şirket geneline yayılabilen yapay zekâ uygulamaları geliştirmesini hedefliyor.




