David Silver'ın son sahneye çıkışı, 2016 Seul'deki bir konferans salonunda gerçekleşti. Daha doğru bir ifadeyle, o, Lee Sedol'ün karşısındaki masanın "arkasında" oturuyordu. Masanın kenarında oturan ise AlphaGo idi.

On yıl geçtikten sonra Google DeepMind'den ayrıldı ve Londra'da kendi işini kurdu. Finansman duyurusu yapıldıktan 24 saatten az bir süre sonra Avrupa'daki girişim sermayesi çevresi soluğunu tuttu: 1 milyar $'lık tohum turu, 5.1 milyar $'lık bir değerlemeye sahip, liderliği Redpoint ve Lightspeed üstlendi, NVIDIA, DST Global, Index, Google, İngiltere'nin egemen yapay zeka fonu gibi bir dizi büyük isim katıldı.
Bu, Avrupa risk sermayesi tarihindeki en büyük tohum turu.
Önce rakamları düzgünce yerine koyalım.
Şirketin adı İfade Edilemez Zeka. 2025 Kasım'ında kurulan şirketin yönetimini bu yılın Ocak ayında resmen DevMind'den ayrılarak devraldı. Şirketin kuruluşundan bu finansmanı almaya kadar geçen süre yarım yıldan azdı.
Tohum turu, 5.1 milyar $ değerleme ile geldi ve neredeyse Mistral'ın bir yıl önceki Seri B turunu eşitledi, aynı dönemde herhangi bir Avrupa yapay zeka girişiminden daha yüksek bir erken aşama değerlemesi elde etti. Yatırımcı listesi nadir bir şekilde Avrupa ve Amerika'nın egemen fonlarını, Silikon Vadisi'nin önde gelen risk sermayesi şirketlerini ve güç sağlayıcıları bir araya getirdi. İngiltere hükümetinden egemen yapay zeka fonu ilk kez bu ölçekte bir erken aşama tura katıldı, bu zaten bir işaretti.
Bu miktarı alan tohum turu, geleneksel anlamda mantıklı değildi. Erken aşama yatırımcıları genellikle büyük yatırım yapmadan önce ürün, gelir veya müşteri gibi en az birini görmeyi bekler. Silver'ın bu turu, tüm adımları atlamak anlamına gelir ve doğrudan orta ölçekli bir halka açık şirket değerlemesi aldığı anlamına gelir.
Para kaynağı konusunda şüphe yoktu. Onlar ürüne değil, bir paradigmaa bahis yaptılar. Bu kararın arkasındaki sebepler ileride açıklanacaktır.
Önce Silver'ın kendi özgeçmişine bir bakalım. On yıl DeepMind'de geçirdikten sonra Atari piksel oyunlarını oynama, AlphaGo, AlphaZero (Go, satranç, shogi'nin insan yapımı olmayan sürümleri), AlphaProof'u (uluslararası matematik olimpiyatlarında gümüş madalya kazanma) öncülük etti veya işbirliği yaptı. Ayrıca UCL profesörüydü. Yani, neredeyse son on beş yılda pekiştirmeli öğrenmeyi akademik bir obsküriteden endüstri başlığına taşıyan kişiydi.

Bu özgeçmişin değeri makale sayısı değil, monopolistik bir söylem hakimiyetidir. Bu alanda aynı anda "akademik itibar + mühendislik geçmişi + ders kitabı statüsü"ne sahip olan kişi, dünya genelinde beşten fazla değildir.
Hikayenin gerçekten aksi mantıkla olduğu yer burası.
GPT, Claude, Gemini gibi bu nesil modeller, aslında insanların yazdığı tüm içeriği ağa yerleştirir, bir semantik olasılık yumruğuna sıkıştırır ve ardından çeşitli sonradan eğitim yöntemleriyle bunu "çağırır". E-posta yazabilir, kod yazabilir, skeç yapabilir çünkü insanlar zaten tüm bunları yazmıştır.
Silver'ın Ineffable web sitesinde belirttiği hedef, bir süper öğrenen, yani süper öğrenen yaratmaktır. Yapmak istediği şey, herhangi bir insan üretilen veriye dayanmamak, kendi "deneyimini" sıfırdan başlayarak, temel hareket becerilerinden "derin bir bilgi patlamasına" kadar öğrenmek.

Bu bir pazarlama sloganı değil, arkasında yayınlanmayı bekleyen bir makale var.
Geçen yıl, Silver ve Güçlendirme Öğrenme ders kitabı yazarı, Turing Ödülü sahibi Richard Sutton, "Deneyim Çağı" başlıklı, yakında MIT Press tarafından yayınlanacak "Bir Zekâ Tasarımı" adlı kitaptan bir alıntı olan bir makale yazmaya başladı. Makalede, tekrar tekrar alıntılanan bir değerlendirme cümlesi bulunmaktadır.
"Matematik, kodlama, bilim gibi temel alanlarda, insan verisinden çıkarılabilen bilgi, hızla sınırına yaklaşmaktadır."
İnsanların yazdığı şeyler neredeyse tamamen model tarafından okunmuştur. Bundan sonra, ön eğitimin marjinal faydası giderek azalacak, ölçekleme kuralı düz bir çizgi haline gelecektir.
Gelecek AI neslinin çıkış yolu, daha büyük eğitim kümesi, daha fazla insan geri bildirimi değil, modelin çevreden kendi deneyimlerini üretmesine izin vermektir. Denemeye gider, başarısız olur, etkileşime girer ve hiç kimsenin yazmadığı şeyleri keşfeder.
Sequoia Capital ortağı duyuruda daha da ileri gitti. "Başarılı olursa, bu Darwin seviyesinde bir bilimsel buluş olacaktır. O'nun yasaları tüm yaşamı açıklar, bizim yasalarımız tüm zekayı açıklar ve inşa eder. "
Bu tür bir konuşma insanların gözlerini devirmesine neden olabilir. Ama hemen devirmekten vazgeçmeyin, en azından Redwood'un gerçek değerlendirmesini açıkça yaptığını kabul edelim. Onların bahse girdiği şey bir sohbet asistanı değil, belirli bir dikey endüstrinin yardımcı pilotu da değil, bir olasılık yeniği.
Silver'ın geçmişinden haberdar olanlar, süper öğrenen bu yaklaşımın yeni olmadığını fark edeceklerdir.
2017'de AlphaZero bunu yaptı. Go, satranç, shogi üç projede, hiçbir insan oyun kitabı kullanılmadan tamamen oyun kendi kendine oynanarak, birkaç saat içinde tüm önceki en güçlü motorları yenmeyi başardı. 2024'te AlphaProof uluslararası matematik olimpiyatında gümüş madalya kazandı, aynı yolu izledi, kendi kendini eğitmek için içeriğini üreten formalize edilmiş kanıtları kullandı.

AlphaProof ekibi ödül aldıktan sonra ofiste "zil çalıyor"
Duyulduğunda çok çekici geliyor. Ancak bu yol, geçen on yıl boyunca neredeyse tüm RL laboratuarlarında duvara çarptı.
Sebep, "kendi kendine oyun"un temiz bir ortam gerektirmesidir. Go'da 19x19'luk oyun tahtası ve siyah-beyaz kuralları bulunur, satrancın sekiz yatay çizgisi ve net bir kazananı vardır. Bu kapalı ortamda, model "kazanmanın" ne olduğunu net bir şekilde bildiğinden dolayı, bu nedenle de net bir şekilde iyileştirebilir.
Ancak görevi "bir müşterinin ödemesini yapacak bir sözleşme yazmak", "kanıtlanmamış bir matematik hipotezini kanıtlamak", "yabancı bir şehirde bir taksiden otele geri dönmek" olarak değiştirirseniz, ödül sinyali nasıl belirlenir, ortam nasıl oluşturulur, bu sorular son on yılda gerçekten çözülen bir şey olmamıştır.
Silver'ın bu seferki bahsi, bu sorunun henüz çözülmediğini açıkça kabul etmek ve ardından 11 milyar dolar, yeni bir ekip, yepyeni bir organizasyonla tekrar işe koyulmaktır.
2026 pazarı, "insan verisi olmadan" AI için 11 milyar dolar bahse hazır, cevap son 12 ayda oldukça izole olmayan sinyallerde gizlidir.
OpenAI'in o3, o4 serisi, eğitimin giderek daha fazla takviye öğrenmeye dayanması. "Düşünme," "çıkarım" gibi yetenekler artık daha büyük ön eğitimden değil, RL aşamasındaki ortam etkileşiminden gelmektedir. DeepSeek R1 hemen ardından takviye öğrenmenin küçük örneğini doğrudan açık kaynaklı kalıba dönüştürdü, biraz mühendislik yeteneği olan herhangi bir ekip, bugün "düşünebilen" küçük bir modeli yeniden üretebilir. RL artık içsel bir DeepMind sırrı değil, endüstri standardı haline gelmiştir.
Daha derine inildiğinde, ön eğitim ölçekleme yasasının zirveye ulaşması hakkındaki tartışma ortaya çıkar ve 2025'in ikinci yarısından itibaren neredeyse her ay yeni bir makale ortaya çıkar. İnsan dilindeki yüksek kaliteli belirteçlerin neredeyse tamamı tüketildiğinde, model boyutunu genişletmenin getirisi belirgin bir şekilde azalmaya başlar. Sermaye tarafı sessizce rotayı değiştirdi; son altı ayda, Silicon Valley'in önde gelen risk sermayesi şirketlerinin AI'ya yaptığı büyük yatırımların çoğu, bir kez daha LLM fabrikaları yerine RL, dünya modeli, ajan gibi "öncesi eğitim sonrası" alanlara düşmeye başladı.
Pazar uzun zamandır "öncesi eğitim sonrası çağı" için cephanelik hazırlıyordu. Sadece bu bayrağı taşıyabilecek bir kişiyi bekliyordu. Silver neredeyse bu rolün ders kitabı cevabıdır. Bu çizgide, hem AlphaGo'nun kamusal tanınırlığına sahiptir, hem de AlphaZero, AlphaProof gibi mühendislik geçmişine, hatta Sutton'la birlikte kaleme aldığı yetkiye sahiptir.
1.1 milyar dolar harcanması nihayetinde pazarın paranın oylamasını yaptığını gösterir. Peki, bu insan verisi gerektirmeyen evrensel bir zekâ yaratmaya yetecek mi?
Kimse bilmiyor. Silver da söylemedi.
Ancak önümüzdeki 12 ay için bazı gözlem noktaları zaten belirlendi. En doğrudan gözlem noktalardan biri, Ineffable'ın AlphaProof'tan daha zor bir "kendi kendine öğrenme" referansı yapması olacak mı, olmayacak mı. Matematik yarışması temiz bir kapalı ortamdır; sonra bir sonraki adım "biçimsiz tanımlı araştırma düzeyinde matematik" ise, zorluk aniden bir seviye yükselir. Bu aşamayı geçmek, hikayenin genelini belirleyebilir.
Sonraki adım, Sequoia'nın hareketlerini gözlemlemektir. Önde gelen bir risk sermayesi şirketi, kutsalın tohum turunu ne kadar ağır bastırdıysa, A turunun tempoyu belirler ve projeye olan dış dünyanın bakışını belirler. Eğer 12 ay içinde 30 milyar dolarlık bir A turu ortaya çıkarsa, bu erken aşamadaki başarıların beklentileri aştığı anlamına gelir. Gecikirse, pazar bu değerlemeyi yeniden ayarlayacaktır.
DeepMind'ın hareketleri de önemli olacak. Silver'ın ayrılmasının ardından, onun liderliğindeki RL ekibinin bir sonraki makalesi nasıl olacak, kimler yazarlık yapacak, ayrılanlar olacak mı, bunlar "bireysel yıldız"dan "kurumsal araştırma kapasitesi"ne geçiş aşamasında bir değerlendirme noktası olacaktır.
Son olarak, Çin'in rolü gözlemlenecek. DeepSeek ve ByteDance'in Byte Seed gibi R1 yolları zaten var; 2026'nın ikinci yarısında kendi "insan verisi olmadan" keşiflerini açıklarlar mı? Bu yol açılırsa, bu sadece Londra'daki bir şirkete ait olmayacaktır.
Ne olursa olsun, üstün öğrenen bu yolu sonuna kadar göğeleyip göğeleyip yürüsün; en azından 1.1 milyar dolar bir konuyu masaya yatırdı. Herkes insan dilini en iyi şekilde taklit edebilir ve kimin daha iyi bir şekilde yapabileceğini tartışırken, bazıları şöyle sormaya başladı: Neden yapay zekanın bize dönüşmesi gerekiyor da bizi daha iyi hale gelme fırsatına sahip olamıyor?
BlockBeats Resmi Topluluğuna Katılın:
Telegram Abonelik Grubu: https://t.me/theblockbeats
Telegram Sohbet Grubu: https://t.me/BlockBeats_App
Twitter Resmi Hesabı: https://twitter.com/BlockBeatsAsia