Skip to content
Neon Apps
Smartphone camera framing a botanical leaf on concrete surface

Yazılım Geliştirme

AI Görüntü Tanıma Uygulaması Nasıl Geliştirilir?

AI görüntü tanıma uygulamaları, fotoğrafları analiz ederek nesne, tür veya ürünleri tanımlar. Bu rehberde nasıl geliştirildiğini, maliyetini ve süresini nelerin belirlediğini ele alıyoruz.

Güven skorunun kaçamayacağı soru 

Her AI görüntü tanıma uygulaması er ya da geç şu soruyu yanıtlamak zorunda: model emin olmadığında kullanıcıya ne gösterilecek. Bu rehber, bir tanıma uygulaması geliştirmenin arkasındaki mimariyi, maliyeti ve süreyi, altında yatan bu güven sorunuyla birlikte inceliyor. 

Bir AI Görüntü Tanıma Uygulaması Ne Yapar 

Bir AI görüntü tanıma uygulaması bir fotoğraf alır ve modelin karşısında ne gördüğünü döndürür. Bu bir bitki türü, bir madeni para veya kullanıcının satın almak istediği bir ürün olabilir. Fortune Business Insights'a göre küresel görüntü tanıma pazarı 2025'te 58,56 milyar dolar değerindeydi ve 2026'da 68,46 milyar dolara ulaşması bekleniyor. Uygulamanın kendisi esas olarak kamera akışını yönetir, fotoğrafı bir sınıflandırma modeline gönderir ve sonucu kullanıcının uygun şekilde güvenebileceği veya sorgulayabileceği bir bağlamla sunar. Bunların hiçbiri sıfırdan bir görüntü işleme modeli kurmayı veya eğitmeyi gerektirmiyor. Doğru yönetilen sağlayıcıyı seçmeyi, kullanılabilir bir fotoğraf yakalayan bir kamera akışı tasarlamayı ve sonucun ne kadar güvenilir olduğu konusunda kullanıcılara dürüst olmayı gerektiriyor. 

Woman examining antique coin in modern product design studio

Tanımayı Çalıştırmanın Üç Yolu 

Her tanıma uygulaması aynı türden bir soruyu yanıtlamıyor ve mimarinin sorulan soruyla eşleşmesi gerekiyor. 

Yaklaşım 

En uygun olduğu durum 

Tradeoff 

Yönetilen sınıflandırma API'si 

Sabit bir kategori setinden tür veya cins belirleme 

Doğruluğu eğitildiği kategorilerle sınırlı 

Görsel benzerlik eşleştirmesi 

Bir perakendeci kataloğunda belirli bir ürünü bulma 

Eşleştirme için canlı, iyi etiketlenmiş bir kataloğa bağımlı 

Cihaz üzerinde çıkarım 

Çevrimdışı tanıma, gizliliğe hassas fotoğraflar 

Daha küçük modeller, genelde daha düşük doğruluk 

Plant Identifier ve Coin Identifier ikisi de bir sınıflandırma sorusunu yanıtlıyor: bu fotoğraf bilinen hangi kategoriye ait. Blushy tamamen farklı bir soruyu yanıtlıyor, bir fotoğrafı bir perakendecinin ürün kataloğuyla eşleştirip kullanıcının gerçekten satın alabileceği bir şey buluyor. Bu sonuç, modelin kendisi kadar katalog kalitesine de bağlı. Core ML veya ML Kit üzerinden cihaz üzerinde çıkarım var ve daha dar görevlerde işe yarıyor, ama Neon Apps bu yaklaşımı teslim etmedi. Apple ve Google'ın yayımladığı rehberler, bunun ağırlığını esas olarak bir ürünün ağa hiç bağımlı olamadığı durumlarda kazandığını gösteriyor. 

Mimariyi soruyla eşleştirmek, en etkileyici görünen modeli seçmekten daha önemli: 

  • Uygulama, bitkiler, madeni paralar veya yaygın nesneler gibi sınırlı ve iyi belgelenmiş bir kategori setinden bir şey tanımlıyorsa yönetilen sınıflandırma API'sini seçin 

  • Hedef bir kategori adlandırmak değil kataloğ içinde belirli bir ürünü bulmaksa görsel benzerlik eşleştirmesini seçin, çünkü bu iki problem farklı alt sistemler istiyor 

  • Cihaz üzerinde çıkarımı yalnızca çevrimdışı kullanım veya sıkı gizlilik kesin bir gereksinim olduğunda seçin, çünkü bu gerçek doğruluğu o garanti için feda ediyor 

Güven gösterimi, üç mimarinin de üzerinde duran dördüncü bir karar. Tek bir skor geliştirmesi kolay ama yanlış okunması da kolay, çünkü çoğu kullanıcının herhangi bir eşleşme yüzdesinin gerçekte ne anlama geldiğine dair bir referansı yok. Coin Identifier'ın yaptığı gibi iki veya üç sıralı alternatif göstermek, kullanıcıya tek bir sayının hiçbir zaman veremeyeceği gerçek bir karar zemini sunuyor. 

İlk Sürümün Kapsamını Nasıl Belirlersin 

Çoğu tanıma uygulamasının başarısızlığı model kalitesinden değil kategori genişliğinden kaynaklanıyor. Dar tutulan bir ilk sürüm, kategori listesi tek bir modelin iyi kaldırabileceğinden fazlasına büyümeden önce temel döngüyü kanıtlıyor. 

  • Bir kategori alanı seçip kod yazmaya başlamadan önce uç durumlarını tanımlayın, çünkü "bitkiler" ile "özellikle zehirli bitkiler" çok farklı kapsam kararları 

  • Güven eşiğinin altında ne olacağına karar verin, çünkü yanlış bir cevabı tam güvenle göstermek dürüst bir "emin değilim, en yakın eşleşmeler bunlar" göstermekten daha kötü 

  • Yakalama rehberliğini tanıma çağrısından önce tasarlayın, çünkü Coin Identifier'ın taramadan önceki ışık ve çerçeveleme ipuçları, sonradan yapılacak herhangi bir model ayarından daha çok girdiyi iyileştiriyor 

Geniş bir kategoride her şeyi tanımaya çalışarak lansmana çıkan ekipler, gerçek dünya fotoğrafları modelin hiçbir zaman iyi tanıyamadığı kategorileri açığa çıkardığında genelde kapsamı sonradan daraltıyor. 

Gerçekçi Bir Geliştirme Takviminin Görünümü 

Bu kategorideki teslim edilen örnekler altı hafta ile iki ay arasında değişiyor, Neon Apps'in en hızlı geliştirdiği kategorilerden biri, ve bu pencereyi dört aşama oluşturuyor. 

  • Keşif ve kapsam belirleme, ekibin herhangi bir ekran tasarlanmadan önce kategori setini, güven eşiği davranışını ve yakalama akışını kilitlediği aşama 

  • Ana geliştirme, takvimdeki en büyük blok, kamera akışının, sınıflandırma çağrısının ve sonuç ekranının o kilitli kapsam üzerinde bir araya geldiği aşama 

  • Temiz referans görsellere değil gerçek dünya fotoğraflarına karşı doğruluk testi, çünkü ışık, açı ve arka plan bir test ortamının dışında çok daha fazla değişiyor 

  • Lansman ve izleme, canlıdaki ilk birkaç hafta, gerçek kullanıcı fotoğraflarının eğitim verisinin yeterince temsil etmediği kategori ve koşulları ortaya çıkardığı dönem 

Gerçek dünya doğruluk testini atlamak, temiz örnek fotoğraflarda mükemmel görünen bir modelin gerçek kullanıcılar taramaya başladığında fark edilir şekilde daha kötü performans göstermesinin en yaygın sebebi. Bulanık fotoğraflar, sert gölgeler ve dağınık arka planlar bir demonun dışında istisna değil normdur. 

Retail fulfillment worker staging garments under overhead camera rig

Bütçeyi ve Süreyi Belirleyen Dört Faktör 

Bir tanıma uygulamasının bütçesini en çok bu dört faktör belirliyor: 

  • Kategori genişliği, çünkü Coin Identifier'ın daha dar kapsamı altı haftada lansmana çıkarken Plant Identifier'ın daha geniş kategori seti iki ay sürdü 

  • Güven arayüzünün derinliği, çünkü Coin Identifier'ın yaptığı gibi güven etiketleriyle sıralı alternatifler göstermek tek bir evet veya hayır cevabından daha fazla tasarım ve test istiyor 

  • Tanıma sonrası özellikler, çünkü bakım hatırlatmaları, değer sorgulama veya alışveriş bağlantıları her biri tanıma çağrısının üzerine kendi kapsamını ekliyor 

  • Katalog bağımlılığı, çünkü Blushy gibi görsel eşleştirme yapan bir uygulama, tek seferlik bir entegrasyon değil ürün kataloğunu güncel tutan sürekli bir içerik hattı istiyor 

Neon Apps, Coin Identifier'ı sıkı kapsamlanmış bir kategori setiyle kabaca altı haftada teslim etti. Plant Identifier iki ay sürdü ve temel tanıma döngüsünün üzerine bir sağlık kontrolü özelliği ile bakım hatırlatmaları ekledi. 

Geliştirme Ücretinin Dışında Kalan Maliyetler 

Geliştirme ücreti uygulamayı kapsar. Sonrasındaki her tarama, sağlayıcının görsel başına veya bin görsel başına fiyatlandırdığı kendi maliyetini taşır. 

  • Yönetilen sınıflandırma API ücretleri, AWS Rekognition'ın standart kademesinde görsel başına kabaca 0,1 ila 0,3 sent arasında, Google Cloud Vision'da ise kullanılan özelliğe bağlı olarak bin birim başına 1,50 dolara kadar değişiyor 

  • Görsel eşleştirme uygulamaları için katalog altyapısı, çünkü Blushy'nin yaklaşımı, tanıma çağrısının kendisinden ayrı, süregelen bir maliyet olan güncel tutulan aranabilir bir ürün indeksi istiyor 

  • Düşük güvenli sonuçlar için manuel inceleme veya yönlendirme yolları, çünkü taramaların bir kısmı otomatik cevabın ötesinde bir alternatif yol gerektirecek 

Ayda bin taramada makul görünen ücretsiz bir kademe, bir uygulama on binlerce fotoğrafı tanımlamaya başladığında gerçek bir maliyet kalemine dönüşebilir. Bu yüzden kullanım sınırları indirmeye göre değil taramaya göre modellenmeli. 

Grid of botanical specimen thumbnails on acrylic panel with loupe

Bu Uygulamalar Canlıda Nerede Aksıyor 

Sınıflandırma modeli nadiren gürültülü hata veriyor. Sessizce hata veriyor, yanlış cevaba güvenli görünerek. 

  • Güvenli yanlış cevaplar, çünkü bir kategoriyi yüksek güvenle belirten bir model kullanıcıya bunu tekrar kontrol etmesi için hiçbir sebep vermiyor, bu da kategorinin gerçek sonuçları olduğunda en çok önem kazanıyor 

  • Eğitim ve gerçeklik uyumsuzluğu, çünkü esas olarak temiz referans fotoğraflarla eğitilmiş bir model, gerçek kullanıcıların çektiği bulanık, kötü aydınlatılmış, garip açılı fotoğraflarda daha kötü performans gösteriyor 

  • Katalog kayması, çünkü görsel eşleştirme yapan bir uygulamanın sonuçları, altta yatan perakendeci kataloğu eşleştirme indeksinden daha hızlı değiştiği anda bayatlıyor 

  • Yakalama kalitesi değişkenliği, çünkü Coin Identifier'ın içine yerleştirdiği ışık ve çerçeveleme rehberliğini atlamak daha çok kötü fotoğrafa ve sonrasında daha çok yanlış sonuca yol açıyor 

  • Kategori sızması, çünkü her "bunu da tanıyabilir mi" isteği, orijinal kapsam onaylandıktan çok sonra eğitim ve test yüzeyini sessizce büyütüyor 

Bunların hiçbiri özenle seçilmiş örnek fotoğraflarla çalıştırılan bir demoda görünmüyor. Gerçek kullanıcılar gerçek, kusurlu fotoğrafları gerçek ışıkta taramaya başladığında ortaya çıkıyor. Bu yüzden dürüst güven iletişimi, ilk yanlış cevap şikayetinden sonra bir yama olarak değil, tasarımın en başından itibaren yer almalı. Bir bitkinin zehirli olup olmadığını belirlemek gibi güvenlikle ilgili kategoriler ekstra dikkat gerektiriyor. Arayüz, sonucu nihai bir cevap değil doğrulama için bir başlangıç noktası olarak çerçevelemeli. 

Teslim Ettiğimiz AI Görüntü Tanıma Uygulamaları 

Neon Apps, her biri farklı bir tanıma sorusunu yanıtlayan üç tanıma uygulaması geliştirdi. 

Proje 

Müşteri 

Yıl 

Geliştirme süresi 

Çözdüğü sorun 

Plant Identifier 

Madduck 

2024 

2 ay 

Bakım ipuçları ve sağlık kontrolüyle fotoğraftan bitki tanıma 

Coin Identifier 

Titano 

2024 

1,5 ay 

Güven etiketleri ve değer aralıklarıyla madeni para tanıma 

Blushy 

Blushy Technologies 

2023 

2 yıl, süregelen 

Kıyafet fotoğraflarını gerçek, satın alınabilir ürünlerle eşleştirme 

Plant Identifier ve Coin Identifier ikisi de sabit bir kategori setine karşı sınıflandırma yapıyor, ama üzerine farklı derinlik inşa etti. Plant Identifier, belirtileri inceleyip olası sorunları öneren bir sağlık kontrolü ve kullanıcıları taramalar arasında geri getiren hatırlatmalar ekledi. Coin Identifier akışın başına yatırım yaptı; tarama gerçekleşmeden önce kullanıcıyı ışık ve çerçeveleme konusunda yönlendirdi, sonra güven etiketli ve güncel piyasa verisinden çekilmiş bir değer aralığı içeren sıralı eşleşmeler gösterdi. Blushy temelde farklı bir problemi çözdü. Bir kategori adlandırmak yerine bir kıyafet fotoğrafını taradı, tek tek giysi parçalarını tespit etti ve kullanıcının gerçekten satın alabileceği gerçek perakendecilerden aynı veya benzer ürünleri buldu. Sınıflandırmadan eşleştirmeye geçen bu farklılık, Blushy'nin iki yıl boyunca aktif geliştirmede kalıp ilk sürümünden çok sonra Android desteği ve daha iyi ürün eşleştirmesi eklemesinin nedeni. İki sınıflandırma uygulaması ise buna karşılık haftalar içinde lansmana çıkıp oturdu. MVP geliştirme sürecini önce tek bir tanıma sorusu etrafında planlamak, üçünün de zamanında lansmana çıkmasını sağladı. Hiçbiri problemin her versiyonunu aynı anda çözmeye çalışmadı. 

Hands pointing smartphone at glass office tower at dusk

İlham Almaya Devam Et

Neon Apps ekibinden hikayeler, içgörüler ve güncellemeler doğrudan gelen kutunuza gelsin.

Sıkça Sorulan Sorular

09Bir projeniz mi var?

Bize Ulaşın

Bir projeniz mi var? Girişimler ve global markalar için dünya standartlarında mobil ve web uygulamaları geliştiriyoruz.

İletişime Geçin