30 Ekim 2013 Çarşamba

Biyoinformatiğe Nasıl Başladım 8

Bu blogda şimdiye kadar bahsettiğim biyoinformatiğe başlama hikayemi mümkün olduğunca kronolojik bir sırayla paylaşmaya çalıştım. Bu süreçte tam bir sıraya sokamadığım ancak yeteneklerimi geliştirdiğini düşündüğüm bazı şeyler de vardı, bu yazıda aklıma gelenleri paylaşmak istedim.

Hayatıma büyük ölçüde etki eden ve kısa vadede hayatımı olumsuz etkileyen, uzun vadede ise faydalarını gördüğüm bir özelliğim olduğunu düşünüyorum: eğer bir şeyin mantığını kavrayamazsam, ondan olabildiğince kaçıyorum. Fakat o mantığa hakim olursam da peşini bırak(a)mıyorum. Üniversiteye kadarki süreçte rahatça -ve bazen aşırıya kaçan şekillerde- sorular sorabildiğim için merak ettiğim şeylerin peşine düşebiliyor ve karmaşık kavramları dahi kolayca özümseyebiliyordum. Ancak üniversitede işler değişti: İngilizce soru sorabilecek olgunluk ve özgüvene ulaşıncaya kadar neredeyse 2 sene kaybettim ve bu nedenle araştırmaktan hoşlanabileceğim birçok konudan uzaklaşmak zorunda kaldım. Çoğu ders kitabı da genelde işin mantığını anlatmaktan ve bir sonraki aşamada sorulabilecek soruları cevaplamaktan acizdi. Hele istatistik kitabını hatırlıyorum da; dersi ancak ikinci alışımda geçebilmiştim ve ders kitabından nefret eder duruma gelmiştim. Garip gelebilir ama, serbestlik derecesi [degrees of freedom] kavramını dahi kolay ve anlaşılır bir şekilde anlatacak bir kitap bulamamıştım uzun süre (2 sene önce sonunda buldum, keşfettiğim kitap şimdi başucu kitabım).

24 Ekim 2013 Perşembe

Dizilim Hizalamada [Sequence Alignment] BLOSUM Matrislerine Etkileşimli Bir Bakış

Hazırladığım web aracından bir ekran görüntüsü
Dizilim Hizalama [Sequence Alignment] ve BLOSUM62 başlıklı yazımda bahsettiğim BLOSUM matrislerini -ve dolayısıyla aminoasitlerin tür benzerliklerine göre birbirlerinin yerine ne oranda geçebildiğini- sadece sayılarla dolu tablolara bakarak anlamanın ne kadar zor olduğundan bahsetmiştim. Oysa, bu matrisleri ağ olarak görüntülediğimizde ve aminoasitlerin gruplarına göre renklendirdiğimizde büyük resmi görmek çok daha kolay hale geliyor, bunu da yine örnek bir ağ ile göstermiştim.

Yine de, farklı BLOSUM matrislerini teker teker görüntülemek veya her bir biyokimyasal özelliğe göre aminoasitleri renklendirmek hem zahmetli bir iş, hem de bu farklı ağ görüntülerini kafamızda canlandırmak bir hayli zor. Bu sorunların üstesinden gelebilmek amacıyla bir web aracı [web tool] hazırladım. 

21 Ekim 2013 Pazartesi

İleri Düzey Uygulamalı Biyoinformatik Eğitimi (23-24 Kasım)

İleri Düzey Uygulamalı Biyoinformatik Eğitimi
*Eğitmeni olduğum bu kursa Biyoakademi üzerinden kayıt olabilirsiniz.
*Bu eğitimden daha fazla faydalanabilmek için Biyoinformatiğin Temelleri Uygulamalı Eğitimi içeriğindeki konulara hakim olmanızı öneririm.

Biyoinformatiğin Temelleri Uygulamalı Eğitimi (9-10 Kasım)

Biyoinformatiğin Temelleri Uygulamalı Eğitimi
*Eğitmeni olduğum bu kursa Biyoakademi üzerinden kayıt olabilirsiniz.
*Bu eğitimde bahsedilecek konulara hakimseniz İleri Düzey Uygulamalı Biyoinformatik Eğitimi ilginizi çekebilir.

Veri Analizinde Uygulanan Adımlar - 7 (Verilerin Temizlenmesi ve Dönüştürülmesi)

Önceki yazımda, sağlıklı verilere nasıl ulaşılabileceği ve elde edilen verilerin de nasıl saklanması gerektiği üzerine birçok noktayı sizinle paylaşmıştım. Bu yazımda ise elde ettiğimiz verilerin nasıl temizlenebileceği ve işlenebileceğine ilişkin temel yaklaşımlardan bahsedeceğim.

Veri analizine ilişkin metinlerde genelde gerektiği kadar anlatılmayan fakat bu işe girmiş istisnasız herkesin karşı karşıya kaldığı bir gerçek vardır: veri -neredeyse hiç bir zaman- temiz değildir. Yani, elimizdeki veriler gerçek verileri içerdiği gibi, analiz sürecini olumsuz olarak etkileyebilecek ve gerçek olmayan verilerle karışmış durumdadır. Bulanık bir suya benzetebilirsiniz bu durumu: olduğu gibi içmeye (analiz etmeye) kalkışırsanız, fayda yerine zarar (yanıltıcı veya eksik sonuçlar) elde edersiniz. Bazı verileri tamamen temizlemek mümkün değildir ancak elinizden geleni yapmalısınız, harcanan bu emeğe değecektir.

10 Ekim 2013 Perşembe

Dizilim Hizalama [Sequence Alignment] ve BLOSUM62

Dizilim hizalama [sequence alignment] biyoinformatiğin en temel problemlerinden biridir ve bu konu üzerine oldukça kafa yorulmuştur. Dizilim hizalamanın temel yaklaşımı, farklı DNA, RNA veya protein dizilimlerinin [sequence] birbirine en çok benzeyen bölgelerinin saptanmasıdır. Bu şekilde biyolojik bir fonksiyonu olabilecek bölgeleri tespit edilebilir veya bir deney sonucunda elde ettiğimiz DNA veya protein diziliminin hangi gen ve organizmaya ait olduğunu büyük ölçüde saptayabiliriz. Örnek bir hizalama aşağıdaki gibi olabilir:

GCACATATGGAAACC
||||||---|||||*
GCACAT---GAAACT

Yukarıda GCACATATGGAAACC dizilimi ile GCACATGAAACT diziliminin hizalanmış şeklini görüyorsunuz. Bu durumda ikinci dizilimin ortasında 3 bazlık bir bölümün silindiğini [deletion] ve sonundaki bazın da değişime uğradığını [mutation] söyleyebiliriz. Hizalama konusunu iki farklı çatı altında düşünebiliriz:

6 Ekim 2013 Pazar

Neden Normal Dağılım?

Çoğu istatistiksel çalışmada hemen hemen hep normallik şartı aranır. Hipotezlerin reddine ya da kabulüne normal dağılıma göre karar verilir. Bir çok teorik dağılım olmasına rağmen örneğin; Binom, Poisson, Beta, Gamma dağılımları vs. neden normal dağılım bu kadar çok sık kullanılıyor? Belki daha önemlisi dağılımını bilmediğimiz bir anakütlenin yada bildiğimiz hiçbir teorik dağılıma uymayan anakütlenin örnekleme araştırmasında neden ısrarla normal dağılım kullanıyoruz sorusunu sorabiliriz.


1 Ekim 2013 Salı

İstatistiksel Deney Tasarımı

Laboratuvar çalışmalarında yapılan deneyler, genellikle pahalı malzemelerle,  kalifiye insan gücü ve uzun süren bir emeğin çalışmasıdır. Bu deneylerin tekrar sayısı arttıkça doğal olarak maliyeti de artmaktadır. Üstelik kervan yolda düzülür mantığıyla yapılan çalışmalarda deneyin amacı dışında gereksiz verilerin elde edilebilmesi için harcanan çabanın eklenmesiyle birlikte maliyet iyice artmaktadır. En başta araştırmanın amacına göre kurulan bir deney tasarımı ile yapılan çalışmalarda ise bu maliyetin ağır yükünü azaltan bir kurtarıcı görevini görür. Deney tasarımı sadece maliyeti azaltmakla kalmaz, deneyin doğruluğunu da arttırır.  Özellikle maliyetinden dolayı tekrarlanma frekansı çok az olan deneylerin sonucunun doğruluğu açısından çok önemlidir. (Önceki yazılarımda örneklemin büyümesiyle çıkarım hatalarının azaldığından bahsetmiştim.)

30 Eylül 2013 Pazartesi

Türkiye'de Özel Sektörde Biyoinformatik Konulu Konuşmam

Geçen hafta Cuma günü, HIBIT 2013 bünyesinde bir konuşmaya davet edildim. Konuşmamda Türkiye'de özel sektörde biyoinformatiğin yerine ilişkin genel bir resim çizdim. Beni ilk kez dinleyenleri biraz hayal kırıklığına uğratmış olabilirim, normalde daha zevkli geçer sunumlarım, ancak bu sefer biraz yorgunluk ve bahsettiğim konudaki olumsuz yönler dolayısıyla enerjimi tam olarak aktaramadım açıkçası. Bu yazımda, konuşmamda bahsettiğim temel noktaları katılamayanlar için özetlemeye çalışacağım.

27 Eylül 2013 Cuma

Mikrodizi mi, Mikrodizin mi?

Başlıkta adı geçen teknolojinin dilimizde nasıl adlandırılması gerektiği konusunda haklı bir kafa karışıklığı var ve bu yazıda doğru karşılığın neden ilki (mikrodizi) olduğunu objektif argümanlarla paylaşmaya çalışacağım. Eğer bu teknolojinin teknik detaylarıyla ilgileniyorsanız Mikrodizi (Microarray) Nedir, Ne Değildir? başlıklı yazıma bir göz atabilirsiniz.

İnsan zihni veri aktarımını temsillerle [representation] gerçekleştirir. Kalem kelimesini duyduğumuzda yahut gördüğümüzde doğrudan bu kelimeyi meydana getiren harfler, şekiller veya sesler yerine doğrudan kalem nesnesini kastederiz ve beynimiz de bu varsayımı temel alır. Bu durum, matematikteki x sembolüyle aynı yaklaşıma sahiptir, tek bir farkla: x herhangi bir şeyi temsil edebilecekken, biz her bir şey için farklı bir isim kullanırız.

İsim meselesine takılmak bu kadar önemli mi diye soruyor olabilirsiniz. Bu meselenin önemi, zihnimizin nasıl çalıştığıyla doğrudan ilişkilidir. Doğduğumuz andan beri (bebekleri gözlemleyin) sürekli bilgi ediniriz ve bunların çoğunu garip şekillerde yaparız: nesnelerin sertliği, yere düşünce nasıl ses çıkardığı, farklı açılardan bakınca neye benzediği, hareket edip etmediği, boyutları ve hangi isimlerle çağırıldığı gibi. Yeni öğrendiğimiz şeyleri de bu deneyimlerimizi ve bu deneyimlerin isimlerini referans alarak zihnimizde şekillendiririz. Doğuştan görme ve duyma engeli olan bir bireyin, bu tarz herhangi bir engeli olmayan bir bireye göre çok daha küçük bir kelime dağarcığına ve gramere sahip olmasının temel nedeni, referans isimlendirmenin daha zayıf ve sınırlı kalmasıdır.

26 Eylül 2013 Perşembe

Veri Analizinde Uygulanan Adımlar - 6 (Veriye Erişim ve Veriyi Saklama)

Gayet uzun bir aradan sonra, bu dizinin yeni yazısıyla tekrar merhaba. Bir önceki yazıda ideal verinin neye benzediğine ilişkin bir çerçeve çizmeye çalışmıştım. Bu yazıda ise bu ideal veriye nasıl ulaşılacağı ve elde edilen verinin nasıl saklanacağına ilişkin kabul gören bazı yaklaşımlardan bahsedeceğim.

Farkettiğiniz üzere, doğru veriyi kullanmak analizin başarısı ve etkinliği üzerinde doğrudan söz sahibi. Bu nedenle, sorduğunuz soruyu cevaplamaya en uygun verinin özelliklerini en başta belirlemeli ve bu titizlikle hareket etmelisiniz. Ya da, elde edebildiğiniz veriler ideal özelliklerin bir kısmını karşılamıyorsa, o zaman da sorunuzu tekrar gözden geçirmeli ve  gerektiği şekilde sınırlamalısınız. Bu yazıyla veriye ilişkin pratik bir konuya giriyoruz: veriye nasıl ulaşmalıyız ve veriyi nasıl saklamalıyız?

Bu konu size biraz basit ve gereksiz gelebilir: çoğu zaman ya elimizde bir veri dosyası vardır, ya sık kullandığımız (genellikle web tabanlı) bir veri tabanına başvuruyoruzdur, ya da bir Google aramasıyla veriye ulaşabiliyoruzdur. Ancak çoğu zaman elde ettiğimiz veriler işlenmiştir; yani budanmış, şekil değiştirmiş, veya özelliği bozulmuş veriler!

24 Eylül 2013 Salı

Primer Tasarımı - 3 (Termodinamik)

Bu serinin ilk yazısında PCR tekniğinden, ikinci yazısında ise hibridizasyondan bahsetmiştim. Bu yazıda ise, primer tasarımının arkasındaki dinamikleri anlamak adına en önemli kavramlardan biri olan termodinamik hesaplamalardan bahsedeceğim. Gözünüzü korkutmasın, matematiksel detaylara girmeden sadece mantığını anlatmaya çalışacağım.

Geçen yazıdan hatırladığınız üzere, primer tasarımdaki en temel amaç, hedeflediğimiz DNA bölgesine karşılık gelen [complementary]  ve böylelikle tam bir hibridizasyona izin veren kısa bir DNA dizilimi oluşturmak. Bu kısa DNA dizilimine primer [başlatıcı/ateşleyici] diyoruz ve primer dememizin temel nedenlerinden biri de tüm süreci başlatması/ateşlemesi.

Bahsettiğimiz hibridizasyon süreci hidrojen bağlarının bağlanması ve kopması üzerine kurulu. Bu bağların kopup bağlanmasını kontrol etmek için de kullandığımız basit ancak etkin bir faktör var: sıcaklık. Sıcaklığı yeterince yükseltirsek fiziksek bağları koparabiliriz, yeterince düşürürsek fiziksek bağların tekrar bağlanması için ortam sağlayabiliriz. Bağları koparmak için 95 ºC çoğu zaman yeterli bir sıcaklık, böylece DNA'nın çift zincirli yapısını ikiye ayırarak iki ayrı tek zincir elde edebiliyoruz. Böylece tasarladığımız primerlerin bağlanabileceği bir DNA yapısına erişiyoruz. Bu aşamada sıcaklığı düşürür, örneğin oda sıcaklığına indirirsek ne olur? Fiziksel bağların kopmasına neden olan şartlar ortadan kalkar ve meydana gelebilecek her türlü kararlı fiziksel bağ ortaya çıkar! Bu duruma özgün olmayan bağlanma [non-specific binding] diyoruz ve bunun iki etkisinden söz edebiliriz. İlki, bu fiziksel bağların öyle kuvvetli olması ki, uzun taslak [template] DNA zincirlerinin de çeşitli biçimlerde bağlanmaya çalışması ve ortaya garip 3 boyutlu şekillerin çıkması. İkinci etki ise, normal şartlarda kararlı bir şekilde oluşmayacak olan primer - taslak DNA bağlantılarının ortaya çıkması. Yani, şartlar oluşursa, A bazının yerine T bazının gelmesini beklerken C bazının bağlanmış olduğunu görebiliriz. Bu, neredeyse her zaman istenmeyen bir durumdur (bu hatalı bağlanmaların istendiği bazı durumlar da var, bir kısmından yeri geldikçe söz edeceğim). Buna bir örnek vereyim: