AI Video Kalitesi Nasıl Ölçülür? VBench Rehberi
AI video kalitesini yalnızca estetikle değil; prompt uyumu, hareket, tutarlılık, fizik ve kontrol edilebilirlikle ölçmek için VBench tabanlı rehber.
Published
Updated
Topic: AI video kalite ölçümü ve model değerlendirme
AI video kalitesi nasıl ölçülür sorusunun kısa cevabı, tek bir “güzel görünüyor” değerlendirmesiyle ölçülemeyeceğidir. Bir model etkileyici bir ilk kare üretebilir; ancak kamera hareketi başladığında öznenin yüzü değişebilir, eller bozulabilir, nesneler fizik kurallarına aykırı hareket edebilir veya prompttaki kritik ayrıntılar kaybolabilir. Bu nedenle model seçimi yaparken estetik izlenimi, talimata uyumu ve zaman içindeki davranışı ayrı ayrı incelemek gerekir.
Bu yaklaşım, akademik değerlendirme çerçevelerinin temel fikriyle örtüşür. VBench çalışması, video üretim kalitesini 16 ayrı boyuta ayırır ve ölçümlerin insan tercihleriyle ilişkisini değerlendirmek için insan incelemelerinden yararlanır. VBench-2.0 çalışması ise fizik, sağduyu, insan doğruluğu, kontrol edilebilirlik ve yaratıcılık gibi daha derin boyutlara odaklanır. Bu yazıdaki yöntem, söz konusu çerçeveleri küçük ekiplerin ve TryVeo kullanıcılarının uygulayabileceği pratik bir test protokolüne dönüştürür.
VBench ve VBench-2.0 neyi farklı ölçer?
VBench, video üretimini tek bir toplam puana indirgemek yerine farklı kalite sinyallerine böler. Bu boyutlar arasında özne kimliği tutarlılığı, hareket akıcılığı, zamansal titreşim ve mekânsal ilişkiler gibi doğrudan gözlenebilen unsurlar bulunur. Böyle bir ayrım, “model A daha iyi” demekten daha kullanışlıdır; çünkü modelin hangi görevde güçlü veya zayıf olduğunu gösterir. Örneğin bir sistem kamera hareketini akıcı üretebilirken prompttaki nesneler arasındaki mesafeyi korumakta zorlanabilir.
VBench-2.0, değerlendirme sorusunu daha da derinleştirir: Video yalnızca düzgün mü görünüyor, yoksa fiziksel ve anlamsal olarak ikna edici mi? Çerçeve; insan doğruluğu, kontrol edilebilirlik, yaratıcılık, fizik ve sağduyu olmak üzere beş ana boyut üzerinden içsel güvenilirliği inceler. Bu, özellikle insan hareketleri, nesne etkileşimleri, neden-sonuç ilişkileri ve ayrıntılı talimatların izlenmesi gereken prodüksiyonlarda önemlidir. Projenin yöntem ve prompt setlerine ilişkin ayrıntılar VBench proje sayfasında yer alır.
VBench ve VBench-2.0’nin yayımlanan kapsamları temel alınarak hazırlanmış uygulama özeti.
| Değerlendirme yaklaşımı | Öne çıkan odak | Pratikte sorulacak soru | Ne zaman yararlı? |
|---|---|---|---|
| VBench | Ayrıştırılmış kalite boyutları | Özne, hareket ve zaman boyunca görüntü ne kadar tutarlı? | Model veya üretim ayarlarını temel kalite açısından karşılaştırırken |
| VBench-2.0 | Daha derin gerçeklik ve talimat sadakati | Fizik, insan anatomisi ve sağduyu açısından sahne ikna edici mi? | Ürün, reklam, eğitim veya anlatı videosunda güvenilirlik gerektiğinde |
| Birleşik mini protokol | Kalite ile kullanım amacını birlikte puanlama | Aynı prompt ve ayarlarda hangi model hangi görevde öne çıkıyor? | TryVeo iş akışı, model seçimi ve yeniden üretim kararlarında |
Tekrarlanabilir bir AI video test protokolü
Adil bir karşılaştırmanın ilk şartı, değişkenleri sabitlemektir. Aynı promptu farklı modellere verirken mümkünse aynı en-boy oranını, video süresini, çözünürlüğü, kamera tanımını ve başlangıç görselini kullanın. Bir model diğerinden farklı bir süre veya varsayılan hareket yoğunluğu kullanıyorsa bunu not edin; aksi halde model farkıyla ayar farkını birbirine karıştırırsınız. Değerlendirme sırasında yalnızca başarılı bir örneği seçmek yerine önceden belirlenmiş sayıda çıktı incelemek de seçme yanlılığını azaltır.
- Test amacını yazın: reklam karesi, ürün tanıtımı, karakter devamlılığı, sosyal medya klibi veya sinematik geçiş gibi tek bir kullanım senaryosu seçin.
- Sekiz ila on iki prompttan oluşan dengeli bir set hazırlayın. Portre, iki öznenin etkileşimi, hızlı kamera hareketi, fiziksel nesne kullanımı ve metin içeren sahne gibi farklı zorluklar ekleyin.
- Her model ve ayar için aynı temel koşulları koruyun. Değiştirdiğiniz parametreleri bir kayıt tablosunda model adı, sürüm, prompt, süre, oran ve çıktı dosyasıyla birlikte tutun.
- Çıktıları önce sessiz ve küçük ekranda, sonra mümkünse tam boyutta izleyin. İlk izlenim ile ayrıntılı incelemeyi ayrı not edin; müzik veya ses, görsel kusurları maskeleyebilir.
- Her videoyu aşağıdaki boyutlarda puanlayın ve her puanın yanına gözlenebilir bir gerekçe yazın. “Kötü” yerine “ikinci saniyede el biçimi değişti” gibi kanıtlanabilir açıklamalar kullanın.
- Sonuçları yalnızca ortalama puanla değil, kullanım amacına göre okuyun. Bir reklam akışı için prompt uyumu daha önemli olabilirken karakter odaklı bir sahnede özne kimliği ve anatomik doğruluk öne çıkabilir.
Puanlama kartı: Hangi kalite boyutlarını ayırmalısınız?
Aşağıdaki kartı 1’den 5’e kadar kullanabilirsiniz: 1 ciddi ve üretimi engelleyen sorun, 3 kullanılabilir fakat düzeltme gerektiren çıktı, 5 ise test amacına güçlü biçimde uyan çıktı anlamına gelir. Puan aralığı burada kurum içi tutarlılık sağlamak için önerilir; VBench veya VBench-2.0’nin akademik ölçümlerini birebir yeniden üretme iddiası taşımaz. Asıl değer, aynı ekibin aynı ölçütleri her modelde uygulamasıdır.
- Prompt uyumu: Özne, eylem, ortam, kamera ve stil talimatları videoda gerçekten gerçekleşiyor mu? Negatif talimatlar veya kompozisyon kısıtları göz ardı ediliyor mu?
- Hareket akıcılığı: Kamera, insan ve nesneler süre boyunca kesintisiz ve doğal mı hareket ediyor? Ani sıçramalar, donmalar veya hız değişimleri var mı?
- Zamansal tutarlılık: Yüz, kıyafet, renk, ışık, arka plan ve nesne kimliği kareler arasında korunuyor mu? Titreşim ya da biçim değişimi hangi saniyede başlıyor?
- Özne ve nesne tutarlılığı: Aynı kişi, hayvan veya ürün başlangıçtaki özelliklerini taşıyor mu? Birden fazla özne varsa roller ve konumlar birbirine karışıyor mu?
- Mekânsal ilişkiler: Ön-arka, sağ-sol, yakın-uzak ve temas ilişkileri korunuyor mu? Kamera hareket ettiğinde sahnedeki geometri anlamını kaybediyor mu?
- Fizik: Yerçekimi, çarpışma, ağırlık, sıvı davranışı, gölge ve momentum sahnenin ima ettiği kurallarla uyumlu mu?
- İnsan doğruluğu: Eller, parmaklar, yüz, eklemler, yürüyüş ve göz hareketleri doğal mı? İnsan bulunan her videoda bu boyutu ayrı inceleyin.
- Sağduyu: Nesneler nasıl tutulur, düşer, açılır veya kullanılır sorularına video makul bir yanıt veriyor mu? Eylem ile sonuç arasında kopukluk var mı?
- Kontrol edilebilirlik: Model, istenen kamera açısını, hareket yönünü, zamanlamayı ve kompozisyonu yeterince izliyor mu? Aynı prompt küçük değişikliklerle yönlendirilebiliyor mu?
- Yaratıcılık ve amaç uygunluğu: Çıktı yalnızca gösterişli mi, yoksa brief’in iletişim amacına hizmet ediyor mu? Beklenmedik ama kullanılabilir fikirler üretiyor mu?
Bu boyutları puanlarken her kategoriyi diğerinden bağımsız düşünün. Örneğin çok yaratıcı bir çıktı, fizik hataları nedeniyle ürün reklamında başarısız olabilir. Benzer şekilde anatomisi temiz bir portre, prompttaki kamera hareketini izlemediği için düşük kontrol edilebilirlik puanı alabilir. Ayrı puanlar, “genel kalite” gibi belirsiz bir izlenimin hangi kusurlardan oluştuğunu görünür kılar.
Prompt setini zorluk seviyelerine bölün
Basit promptlar yalnızca temel görsel kaliteyi gösterir. Daha açıklayıcı bir test için seti üç seviyeye ayırın. Temel seviyede tek özne ve yavaş kamera kullanın. Orta seviyede iki nesne arasındaki ilişkiyi, belirli bir kamera hareketini veya ışık değişimini isteyin. İleri seviyede insan eylemi, nesne etkileşimi, zaman içinde dönüşüm ve birden fazla kısıtı aynı promptta birleştirin. Böylece modelin yalnızca güzel görüntü üretip üretmediğini değil, karmaşık talimatları yönetip yönetemediğini de görürsünüz.
Sonuçları nasıl karşılaştırmalı ve yorumlamalısınız?
Önce her boyutun ortalamasını ayrı hesaplayın; ardından kullanım senaryonuza göre ağırlıklandırın. Bu ağırlıkların evrensel doğrusu yoktur. Ürün çekiminde ürün kimliği, mekânsal ilişki ve fizik daha kritik olabilir. Karakter anlatısında özne tutarlılığı, insan doğruluğu ve hareket akıcılığı öne çıkabilir. Stilize bir sosyal medya klibinde yaratıcılık kabul edilebilirken, teknik eğitim videosunda sağduyu ve kontrol edilebilirlik daha yüksek öncelik taşıyabilir.
Model seçimini yalnızca toplam puana bağlamak yerine bir “başarı profili” oluşturun. Bir modelin güçlü olduğu boyutları ve kırıldığı koşulları not edin: hızlı kamera, kalabalık sahne, eller, yansımalar, sıvılar veya aynı karakterin farklı planlarda görünmesi gibi. Aynı değerlendirmeyi farklı üretim ayarlarıyla tekrarladığınızda sorun modelden mi, prompttan mı, başlangıç görselinden mi kaynaklanıyor daha kolay anlarsınız. TryVeo içindeki AI modelleri sayfası, bu tür karşılaştırmalarda hangi modeli hangi görev için denediğinizi düzenlemeniz açısından başlangıç noktası olabilir.
Her çıktı için 1–5 arası kurum içi puan verin; son sütuna zaman damgalı gözlemi yazın.
| Boyut | Puan | Gözlem örneği |
|---|---|---|
| Prompt uyumu | 1–5 | İstenen kamera hareketi gerçekleşti mi? |
| Hareket ve zaman | 1–5 | Titreşim veya ani sıçrama hangi saniyede görüldü? |
| Özne ve anatomi | 1–5 | Yüz, el, kıyafet ve ürün kimliği korundu mu? |
| Fizik ve sağduyu | 1–5 | Temas, ağırlık ve eylem-sonuç ilişkisi makul mü? |
| Kontrol edilebilirlik | 1–5 | Yön, kadraj ve zamanlama talimata uydu mu? |
| Kullanım amacı | 1–5 | Çıktı brief içinde düzenleme gerektirmeden işe yarıyor mu? |
Sources: VBench Project
TryVeo iş akışında bu yaklaşım nasıl uygulanır?
İlk adım, üretim amacına göre küçük fakat dengeli bir referans seti oluşturmaktır. Her yeni model veya iş akışında aynı seti kullanın; promptları sürekli değiştirirseniz sonuçları karşılaştırmak zorlaşır. Metinden videoya üretim için metinden videoya özelliğine, belirli bir görseli hareketlendirmek için ise görselden videoya özelliğine uygun testler hazırlayabilirsiniz. Bu iki akışın başarısını aynı ölçütle okumak mümkün olsa da, başlangıç görselinin kalitesi ve kompozisyonu sonucu etkileyebileceği için kayıtlarını ayrı tutun.
İkinci adım, değerlendirmeyi üretim döngüsünün parçası yapmaktır. İlk çıktıda yüz tutarlılığı düşükse promptu daha açık yazın veya sahneyi sadeleştirin; kamera kontrolü zayıfsa hareketi tek bir eyleme indirin; fizik sorunu varsa nesne etkileşimini kısa ve gözlenebilir bir aksiyona bölün. Ardından aynı kartla yeniden puanlayın. Bu süreçte yalnızca daha yüksek toplam puanı değil, hangi değişikliğin hangi boyutu iyileştirdiğini de kaydedin. Prompt tasarımı için TryVeo Prompt Academy gibi kaynaklar, test setindeki talimatları daha açık ve karşılaştırılabilir hâle getirmenize yardımcı olabilir.
Son olarak, insan değerlendirmesini tamamen otomatik metriklerle değiştirmeyin. VBench ve VBench-2.0’nin insan yargılarıyla hizalanmayı incelemesi, algılanan kalite ile teknik olarak hesaplanan sinyalin birlikte ele alınması gerektiğini gösterir. Ekip içinde en az iki kişinin aynı klipleri bağımsız puanlaması, kişisel beğeninin etkisini azaltır. Puanlar ayrışıyorsa tartışmadan önce zaman damgalı gözlemleri karşılaştırın; anlaşmazlık çoğu zaman kalite tanımının değil, değerlendirme ölçütünün yeterince açık olmamasından kaynaklanır.
Özetle, AI video kalitesi nasıl ölçülür sorusuna verilecek sağlam yanıt; aynı prompt seti, sabit üretim koşulları, ayrıştırılmış puanlar ve gözlenebilir kanıtlar içeren bir değerlendirme sistemidir. VBench’in çok boyutlu temel yaklaşımıyla VBench-2.0’nin fizik, sağduyu, insan doğruluğu ve kontrol edilebilirlik vurgusunu bir araya getirdiğinizde “en iyi model” arayışını daha anlamlı bir soruya dönüştürebilirsiniz: Bu model, benim sahnem ve üretim amacım için hangi koşullarda güvenilir sonuç veriyor?
Sources
- VBench: Comprehensive Benchmark Suite for Video Generative Models, arXiv — VBench, video üretim kalitesini 16 ayrıştırılmış boyutta değerlendirir ve ölçümleri insan tercihleriyle doğrular.
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness, arXiv — VBench-2.0; insan doğruluğu, kontrol edilebilirlik, yaratıcılık, fizik ve sağduyu olmak üzere beş ana boyutta daha derin video gerçekçiliğini ölçer.
- VBench: Comprehensive Benchmark Suite for Video Generative Models, VBench Project — VBench’in değerlendirme boyutlarını, prompt setlerini, yöntemlerini ve açık kaynak bileşenlerini sunan proje sayfasıdır.
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness, Hugging Face Papers — VBench-2.0 çalışmasının insan değerlendirmesiyle hizalanan çok boyutlu değerlendirme çerçevesini özetler.