Resim: Kelly Sikkema
Columbia Üniversitesi araştırmacıları, akıllı telefonlar, sesli asistanlar ve bağlı cihazlardaki mikrofonlar aracılığıyla ROGUE ses dinlenmesini engelleyebilen yeni bir algoritma geliştirmiştir.
Algoritma tahmin olarak çalışabilir. Kullanıcının daha sonra söyleyeceğini ve sesi kapatmak için gerçek zamanlı olarak obstrüktif sesli arka plan gürültüsü (fısıltı) üretir.
Şimdilik, sistem sadece İngilizce ile çalışır ve yaklaşık% 80'lik bir başarı oranına sahiptir. Gürültünün hacmi nispeten düşük, kullanıcı rahatsızlıklarını en aza indirir ve rahat konuşmaların sağlanması.
Gerçek dünya testleri gösterildiği gibi, sistem, hangi yazılımın kullanıldığı ve mikrofonun konumu ne olursa olsun, otomatik konuşma tanıma teknolojisi ile ayırt edilmesini imkansız hale getirebilir.
Üniversitenin duyurusu aynı zamanda, dilbilimin benzer performansa izin verdiği ve fısıldayarak fısıldayan sesin tamamen anlaşılmaz hale getirdiği daha fazla dile odaklanmak için gelecekteki gelişime de vaat ediyor.
Mikrofonlar, hemen hemen tüm elektronik cihazlara gömülüdür ve özel konuşmalarda belirtilen ürünler için reklamları aldıklarında, yüksek düzeyde otomatik dinlenmedüzü kullanıcıları deneyimi yaşarlar.
Birçok araştırmacı daha önce bu riski, otomatik konuşma tanıma sistemlerini bir noktaya kadar kandırabilecek beyaz gürültü kullanarak azaltmaya çalıştı.
Bununla birlikte, mevcut gerçek zamanlı sesli gizleme yöntemlerinden herhangi birini kullanarak pratik durumlarda imkansızdır, çünkü sesin bugünün donanımıyla mümkün olmayan ani ani hesaplamayı gerektirdiğinden, araştırmacılar.
Bu sorunu çözmenin tek yolu, insan konuşmasından, özelliklerini tanımlayacak, özelliklerini tanımlayacak ve ne kelimelerin beklendiği şeye dayanan rahatsız edici fısıltılar üretmektir.
Paket kaybı gizlenmesine uygulanan derin nöral ağ tahmin modelleri üzerine inşa eden Columbia'nın araştırmacıları, "Tahmini saldırıları" modelini ne dilediklerine dayanarak yeni bir algoritma geliştirdi.
Bu, konuşulan her kelimeyi dikkate almaktır. Konuşma tanıma modellerinin, kullanıcının bu kelimeleri ne zaman söyleyeceğini ve doğru anda bir fısıltının oluşturulması için öngörülmesi için eğitilmiştir.
Modellerini, bu amaç için geriye ve ileri geçişlerle ayarlanan 100 saatlik bir konuşma veri kümesinde sekiz NVIDIA RTX 2080TI GPU'unu kullanarak iki gün boyunca eğitdiler.
Araştırmacılar teknik kağıda açıkladıkça, optimal tahmin süresinin geleceğe 0,5 saniye olduğunu buldular.
Deneyleri, fısıltıların konuşlandırıldığı zaman% 80'i çeşitli konuşma tanıma sistemlerine karşı algoritmayı test etti.
Ek olarak, bilim adamları, her durumda konuşma tanıma sistemleri tarafından tanımlanan sonuçta gerçekçi oda içi testler sundular.
Özellikle, deneyler, "", "", "ve" onlar "gibi daha küçük kelimelerin maskelenmemesi gerektiğini gösterdi, daha uzun kelimeler genellikle algoritmalarının saldırı için daha kolaydır.
Bu çalışma ve bir konuşma salantrasyonunu bozma sisteminin geliştirilmesi, hedeflenen pazarlama için sınırsız veri toplamasına karşı sistemik bir düzenleyici başarısızlığın kanıtıdır.
Bu casusluk önleyici sistemler gelecekte yaygın olarak kullanılmış olsa bile, AI geliştiricileri, rahatsız edici fısıltıların üstesinden gelmek veya etkilerini tersine çevirmek için tanıma yöntemlerini ayarlamaya neredeyse kesinlikle yapacaklar.
Durumun karmaşıklığı arttıkça, daha ezici, insanlar için mahremiyetlerini korumak için ne olur.
Örneğin, evde veya bir ofisteki sessiz bir anti-gizli anti-dinleme aracını dağıtmak, bu araçlar güvenilir olsa bile, bu araçlar güvenilir olsa bile, gerçek zamanlı olarak gerçek zamanlı olarak aktive edici verilere erişmelerini hedefleyen bir potansiyel risk oluşturur.
Konferans uygulamalarındaki 'MUTE' düğmesi aslında mikrofonunuzu kapatamaz
Onlarca Covid Passport uygulamaları, kullanıcının gizliliğini riske atar
Android'deki görsel sesli posta gizlice dinlenmeye karşı savunmasız olabilir
Cesur, arama sonuçlarını zenginleştirmek için tartışmalar ekler
Ahududu Pi, Brute-Force saldırılarını engellemek için varsayılan kullanıcıyı kaldırır
Kaynak: Bleeping Computer