Sayfalar

veri madenciliği etiketine sahip kayıtlar gösteriliyor. Tüm kayıtları göster
veri madenciliği etiketine sahip kayıtlar gösteriliyor. Tüm kayıtları göster

Cumartesi, Ocak 28, 2017

Türkiyede Terör

Kaggle da 'Global Terrorism Database' adında bir veri tabanı yayınlanmış. Dünya çapında 1970 - 2015 yılları arasında 150 binden fazla eylem hakkında bilgiler içeren bir çalışma olmuş. merkezi Maryland Üniversitesi'nde bulunan Terörizm ve Terörle Mücadele Çalışmaları için Ulusal Konsorsiyum (START) araştırmacıları oluşturulmuş ve devam ettirilmektedir.




Bizde bu veritabanından ülkemizde gerçekleşen eyemleri gösterelim dedik.



Teror from bluekid on Vimeo.


Yukardaki haritada 1970 den 2015 in sonuna kadar gerçekleşen eylemler harita üzerinde gösterilmiştir.

Veritabanında Türkiyede geçen  3557 eylem var. Bu eylemleri gerçekleştiren  90 örgüt var.  Faili meçhuller de var elbette.

Yıllara göre Gerçekleştirilen eylem sayısı ve ölümler


 En çok eylemin olduğu yıllar ve eylem sayıları

1992    514
2015    416
1994    300
1991    293
1990    195
2012    189
1977    189
1979    141
1995    133
1989    114
Eylemlerde ölen insan sayılarına baktığımızda yıllara göre  en yüksek 10

1992    1233.0
1994     982.0
1990     512.0
2015     490.0
1991     308.0
2012     248.0
1989     232.0
1995     189.0
1987     187.0
1999     127.0
Örgütler Eyemlerine göre sıralarsak Yüzde olarak


PKK % 45 ile en fazla eylem yapan örgüt olmuş. İşin ilginci ikinci sırada % 36 ile faili meçhul eylemler geliyor.

IŞİD 'in eylem sayısı yüzdesi az olduğuna bakmayın En kanlı eylemler sırasında PKK ile başa baş gidiyorlar.

Son olarak 10 ar yıllık periyotlarda göre yine harita üzerinden fakat Ölüm sayısına göre çember büyüklüklerini değişterek çizdirdiğimiz haritalara göz atın. ilk yıl dahil son yıl dahil değil şeklinde





Elbette son haritamızda mecburen 5 yıllık bir veri var. Ama malesef 10 yılları aratmıyor



Son olarak;  Biz burda Dünya çapında hazırlanmış genel bir veritabanı kullandık. Ülke yöneticilerimizin ulaşabilecekleri çok daha detaylı veriler olduğu aşikardır.
Malum ölçemediğiniz şeyi düzeltemezsiniz de, yönetemezsiniz de. Bi-zahmet inceleyip gereken çıkarımları yapsınlar

Not : Bütün işlemler python kullanılarak yapıldı. Kaggle daki sayfada örnekleri görebilirsiniz.  Bende ordaki kodlardan faydalanıp yazdım zaten. Patron duymadan alel acele bloga yazı yazdığımdan ipython-notebook 'u düzenleyip yayınlıyamadım. Kusuruma bakmayın.

Cumartesi, Kasım 26, 2016

Instagram Hesap Analizi 2

Evet cem yılmazın instagram sayfasını analiz ediyorduk. Devam edelim.

Beğeni ve yorum sayılarında zamanla bir değişim olmuşmudur diye bakalım.  Cem yılmazın instagram hesabında çok sık paylaşım olmadığından doğrudan zamanı kullanmak aldatıcı olur. Bu yüzden her 20 gönderi başına ortalama beğeni ve yorum sayısını hesaplayıp grafiğe döktük. Bizim çalışmamız yapıldığında 340 gönderisi vardı cem yılmazın  340/20 -> 17 tane veri noktası hesaplıyoruz.

Zaman İçinden beğeni sayısının değişimi




Zaman içinde yorum sayısının değişimi


Grafiklerden de belli olduğu gibi sayfanın başlangıcında yorumda beğenide nispeten azmış.
zamanla bu büyük bir artış göstermiş. muhtemelen zaman içinde cem yılmazın instagram sayfasının bilinirliğinin artması ve takipçilerinin çoğalması ile olmuştur.

Toplamda gönderi sayısının azlığı ve zaman içindeki değişim büyüklüğü gibi olumsuzluklar var. Bu zaman içindeki büyük değişim tahmin sistemini olumsuz etkileyeceği aşıkardır. Yinede biz  Görsel olarak az beğenilen çok beğenilen ayrımını yapabilen bir sınıflandırıcı eğitmeye çalıştık.

Resimleri beğeni sayısına göre sıralayıp, en beğenilen 120 ve en az beğenilen 120 resmi iki ayrı sınıf için eğitmek için alıyoruz. Caffe ile bir fine-tune işlemi ile eğitiyoruz ve test ediyoruz.

Sonuç :


Sınıflandırıcımız  ı 46 adet  eğitimde kullanmadığımız  gönderi ile test ediyoruz. Bu gönderilerin 23 tanesi az, 23 taneside çok beğenil olarak seçildi

Sınıflandırıcımız
  •   21 kez bu az beğenilir demiş 16 tanesi doğru sınıflandırılmış
  •  25 kez çok beğenilir demiş 18 tanesi doğru sınıflandırılmış
sınıflandırcının  ortalama doğruluğu % 73.9

Sınıflandırıcımız her iki sınıf içinde bir tahminde bulunur. her sınıfın ihtimalini verir. Toplamda 1 olan bu oranlardan yüksek olanını tahmin olarak kullanıyoruz.

Çok kaba bir beğeni sayısı tahmini yaparsak.

çok beğenilenlerin ortalama beğeni sayısı ->  m_mean
az beğenilenlerin ortalma beğeni sayısı -> l_mean
resmin :
çok beğenilme ihtimali : m_prob
az beğenilme ihtimali :  l_prob

beğeni tahmini = ( m_prob*m_mean  ) + ( l_prob*l_mean )

Mesela :

gönderisi için sistemimiz 10 bin 127 beğeni alır demiş.

Tahmindeki sapmayı ise başta bahsettiğimiz olumsuzluklara,  ilaveten de tahmin yöntemimizin çok kabalığına bağlıyorum. Siz nedersiniz bilmem ama bence yinde sonuç fena değil...

Daha çok gönderisi olan,  takipçi durumu  belli bir düzene girmiş hesaplar için daha başarılı çalışmalar yapılabilir.

Aslında görüntüler üzerinde kümelemelerde yapılıp onun üzeerinden de çıkarımlar yapılabilir. Şimdilik burda bitiriyoruz.

Her türlü görüş ve önerilerinizi bekleriz...

Cumartesi, Kasım 19, 2016

Instagram Hesap Analizi 1

Malumunuz günümüzde sosyal medya denen bir kavram oluştu. İnsanlar kendileri hakkında pek çok bilgiyi kendi elleriyle bu yerlerde paylaşmaktadır. Internet fenomenliği, Sosyal medya uzmanlığı diye işler bile çıktı.

Neyse efendim görüntü üzerine çalıştığımız malum. Görüntü bulmak nispeten kolay olsada, etiketlenmiş veri bulmak çok zor. Biz bu  yazımızda Sosyal Medya kalallarından biri olan Instagram dan veri toplamadan bahsedeceğiz.

Instagram malumunuz genellikle resim paylaşma platformu. Öncelikle bir Instagram hesabı seçiyoruz. Biraz internet araştırması ile meşhurlarımızın Instagram adreslerini bulduk. Keza bir kaçını inceleyince hem popülerliği hemde kısalığı sebebiyle  Cem Yılmaz'ın  sayfasını seçiyoruz.

Python da hem doğrudan Instagrama yönelik hemde genel web den veri çekme amaçlı bir sürü kütüphane bulmanız mümkün. Bunları inceleyip kafanıza yatanı kullanmanızı öneririm.

Peki Cem Yılmazın Instagram sayfasından Biz ne gibi bilgiler çekebildik ;

  • 340 adet resim yüklemiş
  • 187 kişiyi takip ediyor
  • 961205 kişi tarafından takip ediliyor
  • Yayınladıkları için ortalama beğeni sayısı -like mı deseydim -   : 15354.5 
  • Yayınladıkları içinortalma yorum sayısı :  240.4
 Beğeni sayılarının dağılımı - histogram olarak - şöyle

 Yorum sayısı dağılımı da  şöyle


En Beğenilen 6 resim şunlar

 En az Beğenilen 6 resim:

 En çok yorum yapılan 6 resim şunlar

 En az yorum yapılan 6 resim şunlar



En nihayetinde Instagram hesabında kaç resim var resimlerin beğeni sayıları yorum sayıları elimizde. Elbette resim adresleride -link-  leride var.
Neler yapabiliriz

Resimleri kendi içinde görsel özelliklerine göre guruplara ayıra biliriz.
Keza Resimler ve beğeni sayılarını kullanarak beğeni hesabı yapan sistemler eğitmeyi deneyebiliriz.
...
Fırsat bulupda devam edebilirsek bu konuda yapılacak başka şeylerde var.

Cumartesi, Mart 02, 2013

Ordan Burdan Haberler

1) FannTool Sitesine söz verdiğimiz eklemede bulunduk
2)  Veri Madenciliği Kupası Başlıyor ;
      
       DATA MINING CUP competition 2013  
In a few weeks one of the worldwide largest data mining contest the "DATA MINING CUP" competition will start. Last year over 80 international teams from 22 countries participated.

In spring each year the prudsys AG wants to enthuse domestic and international students for intelligent data analysis (data mining) and challenge them to find the best solution to a data mining problem in competition with others.

2013 we want to follow on last year and will place two competition parts again. This year both parts are focussed on the forecast of completing order in online shops.
Besides a classic Data Mining task the second part requires to develop an agent again. More details will be be released with the start of the DMC 2013.

 We are looking forward to your ideas!

 start of registration: March 4, 2013
 start of DMC competition: April 3, 2013
3)  Alman Trafik İşaretleri Yarışması Başladı ;

The "German Traffic Sign Detection" Competition has started!


Results will be presented at IJCNN'13 in Dallas Texas, and FREE REGISTRATION prizes are to be won!


************************
Competition Design
************************
The "German Traffic Sign Detection Benchmark" is a multi-class detection problem in natural images. We do cordially invite you to participate. Our benchmark has the following properties:

* single-image detection problem
* images with zero to four relevant objects
* 900 images (divided in 600 training and 300 evaluation images)
* division in three categories
* industry-relevant application: traffic sign detection

The first competition information was released on December 1, 2012, when the preliminary training data was published. Interested teams are invited to download the training dataset and develop their algorithms based thereon. In February there will be a submission phase where teams are invited to upload their results on a new unannotated test dataset. It will then be possible to immediately compare all competing algorithms via our website.

4) OpenCV 2.4.4 yayınlandı; Java kısmında ve Android portunda epey bir ilerleme var, GPU üzerindeki çalışmalar hem CUDA hemde OpenCL üzerinden devam ediyor....
  •    OpenCV Java bindings are ported from Android to desktop Java! Actually any JVM language will work, see Tutorial for details, and Java or Scala code samples.
  •     Android application framework, samples, tutorials, and OpenCV Manager are improved.
  •     Optimizations for the new NVIDIA Kepler architecture, CARMA platform support and other new optimizations in CUDA.
  •     OpenCL module now builds successfully with various SDKs (from AMD, NVIDIA, Intel and Apple) and runs well on different GPUs (AMD, NVidia, Intel HD4000). A lot of new functionality has been added, tons of bugs fixed, performance of many functions has been significantly improved.
  •     100+ reported problems have been resolved since 2.4.3, thanks everybody who participated!



Pazar, Haziran 26, 2011

KNIME ve Haber Metinlerinin Sınıflandırılması 2

Uygulamamız, Başlıkdanda anlayacağınız gibi Haber Metinlerinin otomatik sınıflandırılması. Uygulamamız için gereken veriyi Kemik den aldık. Kemik  Yıldız  Teknik Üniversitesinin Doğal Dil İşleme Grubu.  Neden Kemik? sorusunuda "Çünkü dilin kemiği yoktur" diye cevaplıyorlar.

Gurubun yayınladığı veri kümelerinden 75Haber diye geçen veri kümesini kullanacağız Veri kümesi  M.Fatih Amasyalı tarafından hazırlanmış ve bu makalede
 Otomatik Haber Metinleri Sınıflandırma", M.Fatih Amasyalı, Tülay Yıldırım, SIU 2004
kullanılmıştır.

5 farklı haber sınıfına ait 15’şer, toplamda 75 haber içermektedir.
Haber metinlerinin sınıfları:
  1. ekonomi
  2. magazin
  3. sağlık
  4. siyasi
  5. spor 

KNIME ile veri okunup test ve eğitim olarak 2 ye ayrıldı ( 50 eğitim 25 test ) SVM ve Weka-Bayes ile sınıflandırma işlemi yapıldı
İşlemin akış şeması


ve Test verileri için sonuçlar şöyle
Bayes  25 yazıdan 22 sini doğru sınıflandırmış
 SVM  ise 25 yazıdan 13'ünü doğru sınıflandırmış

KNIME ve Haber Metinlerinin Sınıflandırılması 1



Öncelikle KNIME de nedir ki sorusuna cevap verelim
KNIME yani "Konstanz Information Miner" almanyada Konstanz üniversitesinde geliştirilmiş açık kaynak kodlu ve ücretsiz bir programdır. Veri madenciliği , Veri yükleme, işleme, yazma,  görselleştirme işlerinizi gayet kolay yapabilirsiniz.



Başlangıçda İlaç endüstrisi için yazılmış olsa da artık pek çok alanda kullanımı mümkün kılan özellikleri var.  mesela
  • CRM müşteri veri analizi, 
  • iş zekası ve finansal veri analizi
  • Doğal Dil İşleme
  • Görüntü İşleme
gibi. Neyse kafı fazla uzatmıyayım.
www.knime.org
adresinden indirip kurmanızı  ve   sonra, ek özelliklerininde (Extensions) kurulması için menüden
"File ->Install KNIME extensions" ile kurulumu tamamlayıp incelemenizi tavsiye ederiz.
( Weka ve R entegrasyonu , Python ve Perl Scripting, LibSVM gibi pek çok özellik bu şekilde ekleniyor )
Bu kadar laftan sonra bir uygulamada hazırlayalım istedik. Bekleyiniz yakında ....