Videodan poz tahmini, artırılmış gerçeklik , işaret dili tanıma, tam vücut hareketi kontrolü ve hatta yoganın temelini oluşturabileceği fiziksel egzersizlerin nicelleştirilmesinde dijital içeriğin ve bilgilerin fiziksel dünyanın üstüne yerleştirilmesini sağlayan kritik bir rol oynar. , dans ve fitness uygulamaları. Zindelik uygulamaları için poz tahmini, çok çeşitli olası pozlar (örneğin, yüzlerce yoga asanası ), çok sayıda serbestlik derecesi, tıkanmalar (örneğin, vücut veya diğer nesneler kameradan görüldüğü gibi uzuvları tıkar) ve çeşitli nedenlerden dolayı özellikle zordur. görünüşler veya kıyafetler.
![]() |
![]() |
![]() |
| BlazePose, fitness ve dans kullanım durumlarıyla ilgili sonuçlar. |
Bugün insan vücudu poz algısı, yeni bir yaklaşım salıverilmesini duyuruyoruz BlazePose biz sunulan en CV4ARVR atölyesinde de CVPR 2020 . Yaklaşımımız, tek bir çerçeveden bir vücudun 33 adet 2B önemli noktasını çıkarmak için makine öğrenimi (ML) kullanarak insan poz takibi sağlar. Standart COCO topolojisine dayalı mevcut poz modellerinin aksineBlazePose, daha fazla anahtar noktayı doğru bir şekilde yerelleştirerek onu fitness uygulamaları için benzersiz bir şekilde uygun hale getirir. Ek olarak, mevcut son teknoloji yaklaşımlar, çıkarım için öncelikle güçlü masaüstü ortamlarına dayanırken, yöntemimiz CPU çıkarımıyla cep telefonlarında gerçek zamanlı performans elde eder. Biri GPU çıkarımından yararlanırsa, BlazePose süper gerçek zamanlı performans elde ederek yüz veya el izleme gibi sonraki ML modellerini çalıştırmasına olanak tanır.
![]() |
![]() |
| MediaPipe üst gövde BlazePose modeli |
Topoloji
İnsan vücudu pozu için mevcut standart , gövde, kollar, bacaklar ve yüz boyunca 17 noktadan oluşan COCO topolojisidir . Bununla birlikte, COCO kilit noktaları yalnızca ayak bileği ve bilek noktalarında yerelleşir, el ve ayaklar için ölçek ve yönelim bilgileri eksiktir, bu da fitness ve dans gibi pratik uygulamalar için hayati önem taşır. Daha fazla anahtar noktanın dahil edilmesi, eller, yüz veya ayaklar için olanlar gibi alana özgü poz tahmin modellerinin sonraki uygulamaları için çok önemlidir.
BlazePose ile, COCO, BlazeFace ve BlazePalm topolojilerinin bir üst kümesi olan 33 insan vücudu anahtar noktasından oluşan yeni bir topoloji sunuyoruz . Bu, yüz ve el modelleriyle tutarlı olan tek başına poz tahmininden vücut semantiğini belirlememizi sağlar.
![]() |
| COCO (yeşil renkli) süper seti olarak BlazePose 33 anahtar nokta topolojisi |
Genel Bakış: Poz İzleme için Makine Öğrenimi Ardışık Düzeni
Poz tahmini için, kanıtlanmış iki adımlı dedektör izleyici makine öğrenimi hattımızı kullanıyoruz . Bir dedektör kullanarak, bu boru hattı ilk olarak çerçeve içindeki poz ilgi bölgesini (ROI) bulur. İzleyici daha sonra bu ROI'den 33 poz kilit noktasının tümünü tahmin eder. Video kullanım durumları için dedektörün yalnızca ilk karede çalıştırıldığını unutmayın. Sonraki çerçeveler için ROI'yi, aşağıda tartışıldığı gibi önceki çerçevenin poz kilit noktalarından türetiyoruz.
![]() |
| İnsan pozu tahmini boru hattına genel bakış. |
BlazeFace'i genişleterek Poz Algılama
Poz algılama ve izleme modellerinden oluşan tam makine öğrenimi ardışık düzeninin gerçek zamanlı performansı için, her bileşenin kare başına yalnızca birkaç milisaniye kullanarak çok hızlı olması gerekir. Bunu başarmak için, sinir ağına gövdenin konumu hakkında en güçlü sinyalin kişinin yüzü olduğunu gözlemliyoruz (yüksek kontrast özellikleri ve nispeten küçük görünüm değişiklikleri nedeniyle). Bu nedenle, tek kişilik kullanım durumumuz için kafanın görünür olması gerektiği şeklindeki güçlü (ancak birçok mobil ve web uygulaması için geçerli) varsayımını yaparak hızlı ve hafif bir poz dedektörü elde ederiz.
Sonuç olarak, poz detektörü için bir vekil olarak milisaniyenin altındaki BlazeFace modelimizden esinlenerek bir yüz dedektörü eğittik . Bu modelin yalnızca çerçeve içindeki bir kişinin konumunu algıladığını ve bireyleri tanımlamak için kullanılamayacağını unutmayın. Öngörülen kilit noktalarından yatırım getirisini elde ettiğimiz Face Mesh ve MediaPipe El izleme ardışık düzenlerinin aksine , insan poz takibi için insan vücudunun merkezini, dönüşünü ve ölçeğini bir daire olarak kesin bir şekilde tanımlayan iki ek sanal anahtar noktayı açıkça tahmin ediyoruz . Leonardo'nun Vitruvius'lu adamından esinlenildi, bir kişinin kalçalarının orta noktasını, tüm kişiyi çevreleyen bir dairenin yarıçapını ve omuz ile kalça orta noktalarını birleştiren çizginin eğim açısını tahmin ediyoruz. Bu, belirli yoga asanaları gibi çok karmaşık durumlarda bile tutarlı izleme ile sonuçlanır. Aşağıdaki şekil yaklaşımı göstermektedir.
![]() |
| Vitruvius adamı, yüz sınırlama kutusuna ek olarak BlazePose dedektörümüz tarafından tahmin edilen iki sanal anahtar nokta aracılığıyla hizalandı |
İzleme Modeli
İşlem hattının poz tahmin bileşeni, her biri üç serbestlik derecesi ( x, y konumu ve görünürlük) artı yukarıda açıklanan iki sanal hizalama anahtar noktası ile 33 kişinin tüm kilit noktalarının konumunu tahmin eder . Hesaplamalı yoğun ısı haritası tahminini kullanan mevcut yaklaşımların aksine , modelimiz aşağıda gösterildiği gibi tüm kilit noktaların birleşik bir ısı haritası / ofset tahminiyle denetlenen bir regresyon yaklaşımı kullanır .
![]() |
| İzleme ağı mimarisi: ısı haritası denetimi ile regresyon |
Spesifik olarak, eğitim sırasında ağın merkezini ve sol kulesini eğitmek için önce bir ısı haritası ve ofset kaybı kullanırız. Daha sonra ısı haritası çıktısını kaldırır ve regresyon kodlayıcıyı (sağ kule) eğitiriz, böylece hafif bir gömmeyi denetlemek için ısı haritasını etkili bir şekilde kullanırız.
Aşağıdaki tablo, farklı eğitim stratejilerinden kaynaklanan model kalitesinin ablasyon çalışmasını göstermektedir. Bir değerlendirme ölçütü olarak,% 20 toleransla Doğru Noktaların Yüzdesini (PCK@0.2) kullanıyoruz (burada, 2B Öklid hatası, karşılık gelen kişinin gövde boyutunun% 20'sinden küçükse, noktanın doğru şekilde tespit edileceğini varsayıyoruz). Bir insan taban çizgisi elde etmek için, açıklayıcılardan birkaç numuneye fazladan açıklama eklemelerini istedik ve 97.2'lik ortalama bir PCK@0.2 elde ettik. Eğitim ve doğrulama, tek tip olarak örneklenmiş, çeşitli pozların coğrafi olarak farklı bir veri kümesi üzerinde yapılmıştır.
Geniş bir müşteri donanımı yelpazesini kapsamak için iki poz izleme modeli sunuyoruz: hız ve kalite dengesi açısından farklılaştırılmış hafif ve tam. CPU üzerinde performans değerlendirmesi için XNNPACK kullanıyoruz ; mobil GPU'lar için TFLite GPU arka ucunu kullanıyoruz .
Uygulamalar
insan poz dayanarak, spor ya da yoga izleyicileri gibi çeşitli uygulamalar, inşa edebilirsiniz. Örnek olarak, kullanıcı istatistiklerini otomatik olarak sayabilen veya gerçekleştirilen egzersizlerin kalitesini doğrulayabilen çömelme ve itme sayaçları sunuyoruz. Bu tür kullanım durumları, ek bir sınıflandırıcı ağı kullanılarak veya hatta normalleştirilmiş poz uzayındaki en yakın pozla eşleşen basit bir ortak ikili mesafe arama algoritmasıyla uygulanabilir.
![]() |
| Saptanan vücut duruşuna göre gerçekleştirilen egzersiz sayısı sayacı. Sol: Çömelme; Sağ: Şınav |
Sonuç Android, iOS ve Python'da çalışan MediaPipe'daki üst gövde kullanım durumlarını hedefleyen
bir BlazePose sürümü yayınladık . BlazePose ayrıca ML Kit'in gelecek sürümünde Pose algılama API'si aracılığıyla daha geniş mobil geliştirici topluluğunun kullanımına sunulacak . Mobil alanın dışında, web tabanlı tarayıcı sürümümüzü de önizliyoruz. Bu insan pozu algılama işlevselliğini daha geniş araştırma ve geliştirme topluluğuna sağlamanın, yaratıcı kullanım durumlarının ortaya çıkmasına, yeni uygulamaların teşvik edilmesine ve yeni araştırma yollarının ortaya çıkmasına neden olacağını umuyoruz.
Bu teknolojiyi daha sağlam ve istikrarlı izleme ile daha da geniş bir insan pozu ve etkinliği çeşitliliğine genişletmeyi planlıyoruz. İlişikteki Model Kartında , bu modellerin kullanımının Google'ın AI İlkeleri ile uyumlu olmasını sağlamak için amaçlanan kullanımları, sınırlamaları ve model adaletini ayrıntılarıyla anlatıyoruz . Bu teknolojiyi yayınlamanın, araştırma ve geliştirici topluluğunun geniş üyeleri tarafından yeni yaratıcı fikirlere ve uygulamalara bir itici güç sağlayabileceğine inanıyoruz. Onunla neler inşa edebileceğinizi görmekten heyecan duyuyoruz!
![]() |
![]() |
| Yoga kullanım durumlarında BlazePose sonuçları |
Teşekkürler
Bizimle teknoloji üzerinde çalışan tüm ekip üyelerimize özel teşekkürler: Fan Zhang, Artsiom Ablavatski, Yury Kartynnik, Tyler Zhu, Karthik Raveendran, Andrei Vakunov, Andrei Tkachenka, Marat Dukhan, Raman Sarokin, Tyler Mullen, Gregory Karpiak, Suril Shah, Buck Bourdon, Jiuqiang Tang, Ming Guang Yong, Chuo-Ling Chang, Juhyun Lee, Michael Hays, Camillo Lugaresi, Esha Uboweja, Siarhei Kazakou, Andrei Kulik, Matsvei Zhdanovich ve Matthias Grundmann.
![]()
GERÇEK: Erişimi Dil Temsil Modellerine Entegre Etme
12 Ağustos 2020 Çarşamba
Yayınlayan: Ming-Wei Chang ve Kelvin Guu, Araştırma Bilim Adamları, Google Araştırması
Doğal dil işlemedeki son gelişmeler, büyük ölçüde , insan ek açıklamaları veya etiketleri olmadan büyük miktarda metin kullanarak genel amaçlı dil temsil modellerini eğiten denetimsiz ön eğitimin gücü üzerine inşa edilmiştir . Gibi Bu önceden eğitilmiş modelleri, bert ve Roberta , görülmüştür dünya bilgisine şaşırtıcı miktarda ezberlemek böyle “doğum yeri olarak, Francesco Bartolomeo Conti ”, “geliştiricisi JDK ” ve “sahibi Sınır TV”. Bilgiyi kodlama yeteneği, soru yanıtlama, bilgi edinme ve metin oluşturma gibi belirli doğal dil işleme görevleri için özellikle önemli olsa da, bu modeller bilgiyi örtük olarak ezberler - yani dünya bilgisi model ağırlıklarında soyut bir şekilde yakalanır - zorlaştırır hangi bilginin depolandığını ve modelde nerede tutulduğunu belirlemek için. Ayrıca, depolama alanı ve dolayısıyla modelin doğruluğu, ağın boyutu ile sınırlıdır. Daha fazla dünya bilgisini yakalamak için standart uygulama, engelleyici şekilde yavaş veya pahalı olabilen, giderek büyüyen ağları eğitmektir.
Bunun yerine, model boyutunu veya karmaşıklığını artırmadan doğru sonuçlar elde etmek için örneğin ek bir büyük harici metin külliyatına atıfta bulunarak bilgiye açıkça erişebilen bir ön eğitim yöntemi olsaydı ne olurdu ? Örneğin, "Francesco Bartolomeo Conti Floransa'da doğdu" adlı harici bir belge koleksiyonunda bulunan bir cümle, modelin içinde depolanan bilgiye erişme konusundaki opak yeteneğine güvenmek yerine, model tarafından müzisyenin doğum yerini belirlemek için referans alınabilir. kendi parametreleri. Bunun gibi açık bilgi içeren metinleri alma yeteneği, modelin milyarlarca parametre kullanmadan bilgi yoğun görevlerde iyi performans göstermesini sağlarken, ön eğitimin verimliliğini artıracaktır.
“In REALM: Alma-Artırılmış Dil Modeli Öncesi Eğitim ” kabul, Makine Öğrenmesi üzerinde 2020 Uluslararası Konferansı , bir olan bir dil gösterimi modeli arttırır dil modeli ön eğitim için yeni bir paradigma paylaşan bilgi retriever REALM modelleri sağlayan, model parametrelerindeki tüm bilgileri ezberlemek yerine, metinsel dünya bilgisini açıkça ham metin belgelerinden almak . Ayrıca, geri alıcının ve dil temsilinin birlikte nasıl eğitilebileceğini göstermek için REALM kod tabanını açık kaynaklı hale getirdik .
Arka Plan: Eğitim Öncesi Dil Temsil Modelleri
Standart dil temsil modellerinin dünya bilgisini nasıl ezberlediğini anlamak için, önce bu modellerin önceden nasıl eğitildiğini gözden geçirmek gerekir. BERT'nin icadından bu yana, maskelenmiş dil modellemesi adı verilen boşluğu doldurma görevi, eğitim öncesi dil temsil modelleri için yaygın olarak kullanılmaktadır. Belirli kelimelerin maskelenmiş olduğu herhangi bir metin verildiğinde, görev eksik kelimeleri doldurmaktır. Bu görevin bir örneği şuna benzer:
I am so thirsty. I need to __ water.
Ön eğitim sırasında, bir model çok sayıda örneği gözden geçirecek ve eksik kelimeleri tahmin etmek için parametreleri ayarlayacaktır ( yukarıdaki örnekte). İlginç bir şekilde, boşlukları doldurma görevi, modelin dünya hakkındaki bazı gerçekleri ezberlemesini sağlar. Örneğin, aşağıdaki örnekte eksik kelimeyi doldurmak için Einstein'ın doğum yeri bilgisi gereklidir: answer: drink
Einstein was a __-born scientist. ( ) answer: German
Bununla birlikte, model tarafından yakalanan dünya bilgisi model ağırlıklarında saklandığı için soyuttur ve hangi bilgilerin depolandığını anlamayı zorlaştırır.
Önerimiz: Erişim Arttırılmış Dil Temsil Modeli Ön eğitim
Standart dil temsil modellerinin aksine, REALM , deneylerimizde destekleyici bilgi olarak harici bir belge koleksiyonundan başka bir metin parçasını ilk olarak alan bir bilgi alıcısı ile dil temsil modelini genişletir. , Wikipedia metin külliyatını kullanıyoruz - ve ardından bu destekleyici metni ve orijinal metni bir dil temsil modeline besliyoruz.
REALM'in temel sezgisi, bir erişim sisteminin, modelin eksik kelimeleri doldurma yeteneğini geliştirmesi gerektiğidir. Bu nedenle, eksik kelimeleri doldurmak için daha fazla bağlam sağlayan bir geri çağırma ödüllendirilmelidir. Elde edilen bilgiler modelin tahminlerini yapmasına yardımcı olmazsa, cesareti kırılarak daha iyi geri kazanımlar için yer açılmalıdır.
Eğitim öncesi sırasında yalnızca etiketlenmemiş metnin mevcut olduğu düşünüldüğünde, bir bilgi alıcısı nasıl eğitilir? Herhangi bir insan notu olmadan, bilgi alıcısını dolaylı olarak eğitmek için kelimeleri doldurma görevini kullanabileceği ortaya çıktı. Sorgunun girişinin şöyle olduğunu varsayalım:
We paid twenty __ at the Buckingham Palace gift shop.
Bu cümledeki eksik kelimeyi ( ) geri çağırmadan doldurmak zor olabilir, çünkü modelin Buckingham Sarayı'nın bulunduğu ülke ve ilgili para birimi hakkında örtük olarak depolanmış bilgisine sahip olması ve ikisi arasındaki bağlantıyı kurması gerekir. Dış bir derlemeden alınan gerekli bilgilerin bir kısmını açıkça birbirine bağlayan bir pasajla sunulsaydı, modelin eksik kelimeyi doldurması daha kolay olurdu. answer:pounds
Bu örnekte, av köpeği aşağıdaki cümleyi aldığı için ödüllendirilecektir.
Buckingham Palace is the London residence of the British monarchy.
Geri alma adımının daha fazla bağlam eklemesi gerektiğinden, eksik kelimeyi doldurmaya yardımcı olabilecek birden fazla geri alma hedefi olabilir, örneğin, " The official currency of the United Kingdom is the Pound." Tüm süreç sonraki şekilde gösterilmektedir:
REALM
Ölçeklendirmenin Hesaplamalı Zorlukları Modellerin milyonlarca belgeden bilgi alabileceği şekilde REALM ön eğitimi zorludur. REALM'de, en iyi belgenin seçimi maksimum dahili ürün araması (MIPS) olarak formüle edilir . Alma işlemini gerçekleştirmek için, MIPS modellerinin öncelikle koleksiyondaki tüm belgeleri kodlaması gerekir, böylece her belge karşılık gelen bir belge vektörüne sahip olur. Bir girdi geldiğinde, sorgu vektörü olarak kodlanır. MIPS'de, bir sorgu verildiğinde, koleksiyondaki belge vektörü ile sorgu vektörü arasında maksimum iç ürün değerine sahip belge, aşağıdaki şekilde gösterildiği gibi alınır:
REALM'de , MIPS'i verimli bir şekilde yürütmek için ScaNN paketini kullanıyoruz, bu da belge vektörlerinin önceden hesaplandığı göz önüne alındığında, maksimum iç ürün değerini bulmayı nispeten ucuz hale getiriyor. Bununla birlikte, model parametreleri eğitim sırasında güncellendiyse, genellikle belge koleksiyonunun tamamı için belge vektörlerini yeniden kodlamak gerekir. Hesaplama zorluklarını ele almak için, geri getiriciyi her belge için gerçekleştirilen hesaplamanın önbelleğe alınabileceği ve eşzamansız olarak güncellenebileceği şekilde yapılandırıyoruz. Ayrıca, belge vektörlerini her adım yerine her 500 eğitim adımında güncellemenin iyi bir performans elde ettiğini ve eğitimi takip edilebilir hale getirdiğini gördük.
REALM'in Açık Alan Soru Cevaplamaya Uygulanması REALM'in
etkinliğini, doğal dil işlemede en yoğun bilgi gerektiren görevlerden biri olan açık alanlı soru cevaplamaya (Açık-QA) uygulayarak değerlendiriyoruz . Görevin amacı, "Eşkenar üçgenin açısı nedir?" Gibi sorulara cevap vermektir.
Standart soru cevaplama görevlerinde (örn. SQuAD veya Doğal Sorular ), destekleyici belge girdinin bir parçası olarak sağlanır, bu nedenle bir modelin yalnızca verilen belgede cevaba bakması gerekir. Açık-Kalite Güvencesinde, verilen belge yoktur, bu nedenle Açık-Kalite Güvencesi modellerinin bilgiyi kendi başlarına aramaları gerekir - bu, Açık-QA'yı REALM'in etkinliğini incelemek için mükemmel bir görev haline getirir.
Aşağıdaki şekil Natural Question'ın OpenQA versiyonundaki sonuçları göstermektedir . Sonuçlarımızı esas olarak açıklamalı destekleyici belgeler olmadan modelleri eğiten başka bir yaklaşım olan T5 ile karşılaştırdık . Şekilden, REALM ön eğitiminin çok güçlü Açık QA modelleri oluşturduğu ve hatta parametrelerin sadece bir kısmını (300M) kullanarak neredeyse 4 puanla çok daha büyük T5 (11B) modelinden daha iyi performans gösterdiği açıkça görülebilir.
Sonuç
REALM'in piyasaya sürülmesi, yakın tarihli bir geri getirme artırılmış üretim modeli de dahil olmak üzere uçtan uca geri getirme artırılmış modellerin geliştirilmesine olan ilgiyi artırmaya yardımcı oldu . Bu çalışma hattını çeşitli şekillerde genişletme olasılığını dört gözle bekliyoruz: 1) bilgi yoğun muhakeme ve yorumlanabilir kaynak gerektiren yeni uygulamalara GERÇEK benzeri yöntemler uygulamak (Açık-QA'nın ötesinde) ve 2) görüntüler, bilgi grafiği yapıları ve hatta diğer dillerdeki metinler gibi diğer bilgi biçimlerine erişme. Araştırma topluluğunun açık kaynak REALM kod tabanıyla ne yaptığını görmekten de heyecan duyuyoruz !
















