AI Video Kalitesi Nasıl Ölçülür? VBench Rehberi

AI video kalitesini yalnızca estetikle değil; prompt uyumu, hareket, tutarlılık, fizik ve kontrol edilebilirlikle ölçmek için VBench tabanlı rehber.

Published

Updated

Topic: AI video kalite ölçümü ve model değerlendirme

Doğal ışıkta AI video kalitesini değerlendiren yaratıcı ekibin çalışma sahnesi

AI video kalitesi nasıl ölçülür sorusunun kısa cevabı, tek bir “güzel görünüyor” değerlendirmesiyle ölçülemeyeceğidir. Bir model etkileyici bir ilk kare üretebilir; ancak kamera hareketi başladığında öznenin yüzü değişebilir, eller bozulabilir, nesneler fizik kurallarına aykırı hareket edebilir veya prompttaki kritik ayrıntılar kaybolabilir. Bu nedenle model seçimi yaparken estetik izlenimi, talimata uyumu ve zaman içindeki davranışı ayrı ayrı incelemek gerekir.

Bu yaklaşım, akademik değerlendirme çerçevelerinin temel fikriyle örtüşür. VBench çalışması, video üretim kalitesini 16 ayrı boyuta ayırır ve ölçümlerin insan tercihleriyle ilişkisini değerlendirmek için insan incelemelerinden yararlanır. VBench-2.0 çalışması ise fizik, sağduyu, insan doğruluğu, kontrol edilebilirlik ve yaratıcılık gibi daha derin boyutlara odaklanır. Bu yazıdaki yöntem, söz konusu çerçeveleri küçük ekiplerin ve TryVeo kullanıcılarının uygulayabileceği pratik bir test protokolüne dönüştürür.

VBench ve VBench-2.0 neyi farklı ölçer?

VBench, video üretimini tek bir toplam puana indirgemek yerine farklı kalite sinyallerine böler. Bu boyutlar arasında özne kimliği tutarlılığı, hareket akıcılığı, zamansal titreşim ve mekânsal ilişkiler gibi doğrudan gözlenebilen unsurlar bulunur. Böyle bir ayrım, “model A daha iyi” demekten daha kullanışlıdır; çünkü modelin hangi görevde güçlü veya zayıf olduğunu gösterir. Örneğin bir sistem kamera hareketini akıcı üretebilirken prompttaki nesneler arasındaki mesafeyi korumakta zorlanabilir.

VBench-2.0, değerlendirme sorusunu daha da derinleştirir: Video yalnızca düzgün mü görünüyor, yoksa fiziksel ve anlamsal olarak ikna edici mi? Çerçeve; insan doğruluğu, kontrol edilebilirlik, yaratıcılık, fizik ve sağduyu olmak üzere beş ana boyut üzerinden içsel güvenilirliği inceler. Bu, özellikle insan hareketleri, nesne etkileşimleri, neden-sonuç ilişkileri ve ayrıntılı talimatların izlenmesi gereken prodüksiyonlarda önemlidir. Projenin yöntem ve prompt setlerine ilişkin ayrıntılar VBench proje sayfasında yer alır.

İki çerçeveyi pratik testte nasıl kullanabilirsiniz?

VBench ve VBench-2.0’nin yayımlanan kapsamları temel alınarak hazırlanmış uygulama özeti.

Değerlendirme yaklaşımıÖne çıkan odakPratikte sorulacak soruNe zaman yararlı?
VBenchAyrıştırılmış kalite boyutlarıÖzne, hareket ve zaman boyunca görüntü ne kadar tutarlı?Model veya üretim ayarlarını temel kalite açısından karşılaştırırken
VBench-2.0Daha derin gerçeklik ve talimat sadakatiFizik, insan anatomisi ve sağduyu açısından sahne ikna edici mi?Ürün, reklam, eğitim veya anlatı videosunda güvenilirlik gerektiğinde
Birleşik mini protokolKalite ile kullanım amacını birlikte puanlamaAynı prompt ve ayarlarda hangi model hangi görevde öne çıkıyor?TryVeo iş akışı, model seçimi ve yeniden üretim kararlarında

Sources: arXiv · arXiv

Tekrarlanabilir bir AI video test protokolü

Adil bir karşılaştırmanın ilk şartı, değişkenleri sabitlemektir. Aynı promptu farklı modellere verirken mümkünse aynı en-boy oranını, video süresini, çözünürlüğü, kamera tanımını ve başlangıç görselini kullanın. Bir model diğerinden farklı bir süre veya varsayılan hareket yoğunluğu kullanıyorsa bunu not edin; aksi halde model farkıyla ayar farkını birbirine karıştırırsınız. Değerlendirme sırasında yalnızca başarılı bir örneği seçmek yerine önceden belirlenmiş sayıda çıktı incelemek de seçme yanlılığını azaltır.

  1. Test amacını yazın: reklam karesi, ürün tanıtımı, karakter devamlılığı, sosyal medya klibi veya sinematik geçiş gibi tek bir kullanım senaryosu seçin.
  2. Sekiz ila on iki prompttan oluşan dengeli bir set hazırlayın. Portre, iki öznenin etkileşimi, hızlı kamera hareketi, fiziksel nesne kullanımı ve metin içeren sahne gibi farklı zorluklar ekleyin.
  3. Her model ve ayar için aynı temel koşulları koruyun. Değiştirdiğiniz parametreleri bir kayıt tablosunda model adı, sürüm, prompt, süre, oran ve çıktı dosyasıyla birlikte tutun.
  4. Çıktıları önce sessiz ve küçük ekranda, sonra mümkünse tam boyutta izleyin. İlk izlenim ile ayrıntılı incelemeyi ayrı not edin; müzik veya ses, görsel kusurları maskeleyebilir.
  5. Her videoyu aşağıdaki boyutlarda puanlayın ve her puanın yanına gözlenebilir bir gerekçe yazın. “Kötü” yerine “ikinci saniyede el biçimi değişti” gibi kanıtlanabilir açıklamalar kullanın.
  6. Sonuçları yalnızca ortalama puanla değil, kullanım amacına göre okuyun. Bir reklam akışı için prompt uyumu daha önemli olabilirken karakter odaklı bir sahnede özne kimliği ve anatomik doğruluk öne çıkabilir.

Puanlama kartı: Hangi kalite boyutlarını ayırmalısınız?

Aşağıdaki kartı 1’den 5’e kadar kullanabilirsiniz: 1 ciddi ve üretimi engelleyen sorun, 3 kullanılabilir fakat düzeltme gerektiren çıktı, 5 ise test amacına güçlü biçimde uyan çıktı anlamına gelir. Puan aralığı burada kurum içi tutarlılık sağlamak için önerilir; VBench veya VBench-2.0’nin akademik ölçümlerini birebir yeniden üretme iddiası taşımaz. Asıl değer, aynı ekibin aynı ölçütleri her modelde uygulamasıdır.

Bu boyutları puanlarken her kategoriyi diğerinden bağımsız düşünün. Örneğin çok yaratıcı bir çıktı, fizik hataları nedeniyle ürün reklamında başarısız olabilir. Benzer şekilde anatomisi temiz bir portre, prompttaki kamera hareketini izlemediği için düşük kontrol edilebilirlik puanı alabilir. Ayrı puanlar, “genel kalite” gibi belirsiz bir izlenimin hangi kusurlardan oluştuğunu görünür kılar.

Prompt setini zorluk seviyelerine bölün

Basit promptlar yalnızca temel görsel kaliteyi gösterir. Daha açıklayıcı bir test için seti üç seviyeye ayırın. Temel seviyede tek özne ve yavaş kamera kullanın. Orta seviyede iki nesne arasındaki ilişkiyi, belirli bir kamera hareketini veya ışık değişimini isteyin. İleri seviyede insan eylemi, nesne etkileşimi, zaman içinde dönüşüm ve birden fazla kısıtı aynı promptta birleştirin. Böylece modelin yalnızca güzel görüntü üretip üretmediğini değil, karmaşık talimatları yönetip yönetemediğini de görürsünüz.

Sonuçları nasıl karşılaştırmalı ve yorumlamalısınız?

Önce her boyutun ortalamasını ayrı hesaplayın; ardından kullanım senaryonuza göre ağırlıklandırın. Bu ağırlıkların evrensel doğrusu yoktur. Ürün çekiminde ürün kimliği, mekânsal ilişki ve fizik daha kritik olabilir. Karakter anlatısında özne tutarlılığı, insan doğruluğu ve hareket akıcılığı öne çıkabilir. Stilize bir sosyal medya klibinde yaratıcılık kabul edilebilirken, teknik eğitim videosunda sağduyu ve kontrol edilebilirlik daha yüksek öncelik taşıyabilir.

Model seçimini yalnızca toplam puana bağlamak yerine bir “başarı profili” oluşturun. Bir modelin güçlü olduğu boyutları ve kırıldığı koşulları not edin: hızlı kamera, kalabalık sahne, eller, yansımalar, sıvılar veya aynı karakterin farklı planlarda görünmesi gibi. Aynı değerlendirmeyi farklı üretim ayarlarıyla tekrarladığınızda sorun modelden mi, prompttan mı, başlangıç görselinden mi kaynaklanıyor daha kolay anlarsınız. TryVeo içindeki AI modelleri sayfası, bu tür karşılaştırmalarda hangi modeli hangi görev için denediğinizi düzenlemeniz açısından başlangıç noktası olabilir.

Örnek değerlendirme kartı

Her çıktı için 1–5 arası kurum içi puan verin; son sütuna zaman damgalı gözlemi yazın.

BoyutPuanGözlem örneği
Prompt uyumu1–5İstenen kamera hareketi gerçekleşti mi?
Hareket ve zaman1–5Titreşim veya ani sıçrama hangi saniyede görüldü?
Özne ve anatomi1–5Yüz, el, kıyafet ve ürün kimliği korundu mu?
Fizik ve sağduyu1–5Temas, ağırlık ve eylem-sonuç ilişkisi makul mü?
Kontrol edilebilirlik1–5Yön, kadraj ve zamanlama talimata uydu mu?
Kullanım amacı1–5Çıktı brief içinde düzenleme gerektirmeden işe yarıyor mu?

Sources: VBench Project

TryVeo iş akışında bu yaklaşım nasıl uygulanır?

İlk adım, üretim amacına göre küçük fakat dengeli bir referans seti oluşturmaktır. Her yeni model veya iş akışında aynı seti kullanın; promptları sürekli değiştirirseniz sonuçları karşılaştırmak zorlaşır. Metinden videoya üretim için metinden videoya özelliğine, belirli bir görseli hareketlendirmek için ise görselden videoya özelliğine uygun testler hazırlayabilirsiniz. Bu iki akışın başarısını aynı ölçütle okumak mümkün olsa da, başlangıç görselinin kalitesi ve kompozisyonu sonucu etkileyebileceği için kayıtlarını ayrı tutun.

İkinci adım, değerlendirmeyi üretim döngüsünün parçası yapmaktır. İlk çıktıda yüz tutarlılığı düşükse promptu daha açık yazın veya sahneyi sadeleştirin; kamera kontrolü zayıfsa hareketi tek bir eyleme indirin; fizik sorunu varsa nesne etkileşimini kısa ve gözlenebilir bir aksiyona bölün. Ardından aynı kartla yeniden puanlayın. Bu süreçte yalnızca daha yüksek toplam puanı değil, hangi değişikliğin hangi boyutu iyileştirdiğini de kaydedin. Prompt tasarımı için TryVeo Prompt Academy gibi kaynaklar, test setindeki talimatları daha açık ve karşılaştırılabilir hâle getirmenize yardımcı olabilir.

Son olarak, insan değerlendirmesini tamamen otomatik metriklerle değiştirmeyin. VBench ve VBench-2.0’nin insan yargılarıyla hizalanmayı incelemesi, algılanan kalite ile teknik olarak hesaplanan sinyalin birlikte ele alınması gerektiğini gösterir. Ekip içinde en az iki kişinin aynı klipleri bağımsız puanlaması, kişisel beğeninin etkisini azaltır. Puanlar ayrışıyorsa tartışmadan önce zaman damgalı gözlemleri karşılaştırın; anlaşmazlık çoğu zaman kalite tanımının değil, değerlendirme ölçütünün yeterince açık olmamasından kaynaklanır.

Özetle, AI video kalitesi nasıl ölçülür sorusuna verilecek sağlam yanıt; aynı prompt seti, sabit üretim koşulları, ayrıştırılmış puanlar ve gözlenebilir kanıtlar içeren bir değerlendirme sistemidir. VBench’in çok boyutlu temel yaklaşımıyla VBench-2.0’nin fizik, sağduyu, insan doğruluğu ve kontrol edilebilirlik vurgusunu bir araya getirdiğinizde “en iyi model” arayışını daha anlamlı bir soruya dönüştürebilirsiniz: Bu model, benim sahnem ve üretim amacım için hangi koşullarda güvenilir sonuç veriyor?

Sources

  1. VBench: Comprehensive Benchmark Suite for Video Generative Models, arXiv — VBench, video üretim kalitesini 16 ayrıştırılmış boyutta değerlendirir ve ölçümleri insan tercihleriyle doğrular.
  2. VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness, arXiv — VBench-2.0; insan doğruluğu, kontrol edilebilirlik, yaratıcılık, fizik ve sağduyu olmak üzere beş ana boyutta daha derin video gerçekçiliğini ölçer.
  3. VBench: Comprehensive Benchmark Suite for Video Generative Models, VBench Project — VBench’in değerlendirme boyutlarını, prompt setlerini, yöntemlerini ve açık kaynak bileşenlerini sunan proje sayfasıdır.
  4. VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness, Hugging Face Papers — VBench-2.0 çalışmasının insan değerlendirmesiyle hizalanan çok boyutlu değerlendirme çerçevesini özetler.