Gerçek iş yükleri içinölçeklenebilir ve güvenliLLM altyapısı
Bulutistan LLMaaS ile büyük dil modellerini dakikalar içinde uygulamalarınıza entegre edin. Türkiye'de konumlanan, düşük gecikmeli ve production-ready altyapı üzerinde; token bazlı, esnek ve güvenli kullanım.
Kurulum yükü olmadan başlayın, kullanım arttıkça kolayca ölçeklenin.
- Veriler Türkiye'de kalır
- Production-ready altyapı
- Düşük gecikme
- Token bazlı kullanım
$ Model, regülasyon ve stabilite — tek katmanda.
Kurumsal AI projeleri yalnızca modele değil; altyapı güvenine, regülasyon uyumuna ve stabil performansa ihtiyaç duyar. Bulutistan LLMaaS bu üç ihtiyacı tek bir servis katmanında birleştirir.
- Türkiye uyumlu veri konumlandırmaVeri işleme ve depolama yerel altyapı üzerinde kalır.
- Yüksek performanslı inferenceOptimize edilmiş servis katmanı ile düşük p95.
- Senaryoya uygun modelChat, agent, doküman — farklı modeller tek uçtan.
- Token bazlı esnek ölçekPoC'den yüksek hacme kadar aynı altyapı.
Model değil, üretim hattı satın alın.
LLMaaS (Large Language Model as a Service), büyük dil modellerini API üzerinden kullanmanızı sağlayan bir hizmet modelidir.
Kendi GPU altyapınızı kurmak, model servis katmanını yönetmek, ölçekleme ve erişim operasyonlarını tasarlamak yerine; hazır bir servis üzerinden doğrudan model çıktısı alırsınız.
Ekipler, altyapı karmaşıklığıyla değil; ürün geliştirme, entegrasyon ve iş değerine odaklanır.
— Daha az operasyon, daha hızlı entegrasyon, daha öngörülebilir maliyet.

Katman katman düşünüldü. Tek uçtan sunuldu.
Dört temel ilke etrafında kurgulandı: yerel uyum, stabil performans, doğru model seçimi ve öngörülebilir ekonomik büyüme.
Türkiye uyumlu altyapı
Verilerinizin Türkiye'de kalmasını destekleyen altyapı yaklaşımıyla, kurumsal güvenlik ve regülasyon beklentilerine uygun bir temel.
Yüksek performanslı inference
Optimize edilmiş servis katmanı; düşük gecikmeli, stabil ve yoğun kullanıma uygun model erişimi.
Esnek model seçimi
Farklı iş senaryoları için uygun open-source model alternatifleri arasından seçim; doğruluk-performans-maliyet dengesi.
Ölçeklenebilir maliyet yapısı
Token bazlı kullanım modeli; küçük denemelerden yüksek hacimli üretim senaryolarına kadar kontrollü büyüme.
AI fikirlerini ürüne taşıyan ekipler için tasarlandı.
Yazılım, ürün, BT ve inovasyon ekiplerinin LLM tabanlı projeleri daha hızlı hayata geçirebilmesi için kurgulandı.

- Yazılım ekipleriAPI tabanlı hızlı entegrasyon ve kısa geliştirme süreci.
- Ürün ekipleriChat, özetleme, sınıflandırma ve otomasyon akışlarını hızla devreye alın.
- Kurumsal BTGüvenlik, kontrol ve ölçeklenebilirlik beklentilerini aynı anda karşılar.
- İnovasyon ekipleriPoC'den production'a geçişi hızlandırır.
OpenAI uyumlu SDK
Mevcut client kütüphaneleriniz ve entegrasyonlarınız tek uç değişikliğiyle çalışmaya devam eder.
Akıllı yönlendirme
Trafik, farklı modellere istek özelinde yönlendirilebilir; her çağrı için en uygun servis seçilir.
Streaming çıktı
Chat ve agent senaryolarında token-by-token akış; ilk yanıt süresi ciddi oranda azalır.
Rate limit & kota
Organizasyon, proje ve API key düzeyinde kota; kullanım tahminlenebilir kalır.
Observability
Token sarfiyatı, gecikme ve hata metrikleri için görünürlük; kullanım mühendislik dostu biçimde raporlanır.
Dedike kapasite
Hacim ve SLA gereksinimleri arttığında aynı API arkasında dedike kapasite sunulabilir.
Tek servis katmanı, birçok AI ürünü.
Farklı AI ürünlerini ve akıllı otomasyon akışlarını aynı altyapı üzerinden besleyin.
AI Chatbots
Müşteri iletişimi, destek süreçleri ve dahili bilgi erişimi için sohbet deneyimleri.
AI Agents
Belirli görevleri otonom yürüten agent tabanlı iş akışları.
Document Processing
Dokümanları analiz edin, özetleyin, sınıflandırın ve anlamlandırın.
Code Assistants
Geliştirici üretkenliğini artıran kod destek ve açıklama akışları.
Internal Knowledge
Kurumsal bilgiye daha hızlı erişim sağlayan iç kullanım asistanları.
Workflow Automation
Destek, operasyon ve içerik süreçlerinde tekrar eden işleri AI ile hızlandırın.
Dakikalar içinde canlıya.
PoC, pilot ve production senaryoları için aynı servis yapısı. Kurulum karmaşıklığı yok.
- 01
API erişiminizi oluşturun
Konsol üzerinden organizasyon ve API key oluşturun, erişimi saniyeler içinde başlatın.
export BULUT_KEY="blt_live_********" - 02
İhtiyacınıza uygun modeli seçin
Chat, agent, doküman veya kod. Her senaryo için doğru modeli belirleyin.
model: "qwen3-next-80b-instruct" - 03
Request gönderin, çıktıyı alın
OpenAI uyumlu uç üzerinden entegrasyonu tamamlayın; streaming veya tek seferde yanıt alın.
POST /v1/chat/completions - 04
Kullanım arttıkça ölçeklenin
Aynı altyapı üzerinde PoC'den yüksek hacme kadar kontrollü büyüyün; kota ve kapasite ihtiyaca göre ayarlanır.
autoscale: true
Kurumsal beklentiler için tasarlanmış temel.
LLM projelerinde yalnızca model kalitesi değil; verinin nerede işlendiği, erişimin nasıl yönetildiği ve altyapının ne kadar öngörülebilir olduğu da kritiktir.
Bulutistan LLMaaS; Türkiye uyumluluğu, kurumsal kullanım odağı ve production-ready servis yaklaşımıyla bu ihtiyaca cevap verir.
- Yerel veri konumuTalepler ve log akışı Türkiye sınırları içinde işlenir.
- Organizasyon bazlı izolasyonProje ve key düzeyinde erişim, yetki ve kota yönetimi.
- Denetlenebilir kullanımTüketim ve hata metriklerinin bağımsız raporlanabilmesi.
- Stabil servis seviyesiKapasite planlama ve ölçekleme yaklaşımıyla öngörülebilir performans.

İhtiyacına uygun model — şeffaf, token bazlı fiyat.
Farklı kullanım senaryoları için optimize edilmiş modellerle, doğruluk-performans-maliyet dengesini ihtiyacınıza göre kurun. Kullandığınız token kadar ödeyin.

qwen3-next-80b-instruct
Qwen3-Next 80B MoE · hybrid attentionQwen3-Next 80B MoE (3B active) — Gated DeltaNet + Gated Attention hibrit dikkat mimarisiyle. Qwen3-235B kalitesine yaklaşan çıktıyı ~1/3 maliyetle sunar. Chat, agent ve uzun-bağlam senaryolarına uygun.
- Context
- 131K
- Profile
- chat · completion
- Pricing
- $0.61 / $3.20

gpt-oss-120b
OpenAI gpt-oss MoE · 5.1B activeOpenAI gpt-oss-120b MoE (117B total, 5.1B active). MXFP4 quantized, harmony response format ve yapılandırılabilir reasoning seviyeleri. Kurumsal genel-amaçlı senaryolar için dengeli profil.
- Context
- 131K
- Profile
- chat · completion
- Pricing
- $0.61 / $3.20

gemma-4-26b
Gemma 4 26B MoE · multimodal · tool-useGemma 4 26B MoE (26B total, 3.8B active) — hibrit sliding + global attention. Text ve görsel girdiyi tek modelde işler, tool-use destekler. Multimodal chat, vision-aware agent ve karma içerik senaryoları için uygun.
- Context
- 131K
- Profile
- text · vision · tools
- Pricing
- $0.40 / $2.20
Token bazlı, öngörülebilir fiyat.
PoC'den yüksek hacimli üretim trafiğine kadar aynı fiyatlama mantığı. Kapasite ve regülasyon ihtiyacın arttığında dedike plana geçilir.
| Model | Input · 1M tk | Output · 1M tk | Bağlam |
|---|---|---|---|
| qwen3-next-80b-instruct | $0.61 | $3.20 | 131K |
| gpt-oss-120b | $0.61 | $3.20 | 131K |
| gemma-4-26b | $0.40 | $2.20 | 131K |
Fiyatlar 1M token başınadır. KDV hariç.
Yüksek hacim, dedike kapasite veya özel SLA mı gerekiyor?
Dedike kapasite, yazılı SLA, KVKK uyum eki ve VPN / IP whitelist gibi kurumsal ihtiyaçlar için çözüm mühendislerimizle görüşün. Kullanım senaryonuza özel teklif hazırlayalım.
Fiyat ve kotalar hizmet sözleşmesinde yazılı olarak teyit edilir. Listede gösterilen rakamlar gösterim amaçlıdır.
LLM tabanlı ürünlerinizi
bugün geliştirmeye başlayın.
Güvenli, ölçeklenebilir ve kurumsal kullanıma hazır LLM altyapısıyla ekibinizi hızla üretime taşıyın.
Dakikalar içinde başlayın, ihtiyaç arttıkça aynı yapı üzerinde büyüyün.
Sık sorulan sorular.
Yeni model, sürüm ve etkinliklerden ilk sen haberdar ol.
Sadece anlamlı duyurular. Spam yok, ürün satışı yok — yalnızca yeni modeller, sürüm notları ve teknik etkinlikler.