1M AI Haberlerine göre, 4 Mart'ta Google, Gemini 3.1 Flash-Lite ön izleme sürümünü yayınladı. Bu sürüm, Gemini 3 serisinin en hızlı ve en düşük maliyetli modeli olarak konumlandırılmıştır. Bu model, Gemini 3 Pro mimarısına dayanmakta olup Karışık Uzmanlar (MoE) tasarımını kullanmaktadır, bu tasarımda sadece bazı parametreler etkinleştirilerek çıkarım maliyeti düşürülmektedir. API fiyatlandırması giriş için $0.25/milyon token, çıkış için $1.50/milyon token olup bu değerler sırasıyla Gemini 3.1 Pro ($2/$18) için yaklaşık 1/8'lik bir orandır.
Performans açısından, Gemini 2.5 Flash'e göre, ilk token gecikmesi 2.5 kat azalmış, çıkış hızı %45 artmış ve saniyede 363 token'a ulaşılmıştır. En fazla 1 milyon token giriş ve 64 bin token çıkışı destekler, metin, resim, ses ve video girişlerini kabul eder. 11 iç benchmark testinde, Flash-Lite 6 testte GPT-5 mini ve Claude 4.5 Haiku'yu geçmiş, GPQA Diamond (%86.9), MMMU-Pro (çoklu modlu çıkarım) (%76.8), LiveCodeBench (kod oluşturma) (%72.0) başarılarına ulaşmıştır.
Bu model, ayarlanabilir "düşünme seviyeleri"ne sahiptir, geliştiriciler AI Studio ve Vertex AI'da modelin çıkarım derinliğini kontrol edebilir, yüksek frekanslı senaryolarda kalite ile maliyeti dengeleyebilirler. Şu anda Gemini API (Google AI Studio) ve Vertex AI aracılığıyla ön izleme erişimi sağlanmaktadır.
