Mostrando las entradas con la etiqueta bioinformática. Mostrar todas las entradas
Mostrando las entradas con la etiqueta bioinformática. Mostrar todas las entradas

martes, junio 07, 2011

Visit to Poland: Roche 454 GS Junior Data

I was visiting my friend Miroslaw Kwasniewski an Assistant Professor at the University of Silesia in Katowice, Poland. He is got a GS Junior 454 machine which I wanted to check out. Besides that, he wanted some help with their bioinformatics servers and pipelines.


I was just looking at one dataset, transcriptomics from barley, obtained from the GS Junior, and read counts, read lengths and quality are all great, very impressive. I have some statistics obtained using FastQC, after exporting the SFF file from GS Junior to FastQ format using sff_extract.

This is the distribution of the read quality on a per base basis. As you can see, reads can be well over 400, around 500bp with Phred qualities above 20.


The sequence length distribution has a nice peak around 500 bp.


GS Junior could achieve 100.000 reads throughput, Mirek was getting 150.000 reads.

GS Junior seem to be quite good for sequencing low complexity samples. Quality and length of the sequencing reads is great, but depth for a e.g., full transcriptome in angiosperms, would be either challenging or too expensive. It is great for amplicon sequencing, bacterial genome sequencing, virus genome sequencing, i.e., would be great for the phages (!).

viernes, junio 03, 2011

Secuenciación del genoma de cepa de E. coli que está causando problemas en Alemania

En mayo de 2011 un brote de diarrea hemorragica se desató en los estados de la región norte de Alemania. Varios de los casos reportados causaban sindrome urémico hemolítico, caracterizado por insuficiencia renal y transtornos neurológicos. Investigadores alemanes identificaron que el agente responsable de brote es una nueva variante de la bacteria Escherichia coli entero-hemorrágica (EHEC, por sus siglas en inglés) serotipo O104.

El Instituto de Genómica de Beijing (BGI) acaba de liberar las secuencias crudas obtenidas usando Ion Torrent de la cepa de E. coli que está causando el brote de EHEC en Alemania.

El BGI liberó las lecturas crudas correspondientes a 5 corridas del Personal Genome Machine (PGM) de Ion Torrent, los datos están disponibles en el NCBI SRA con el número de acceso: SRA037315. Los datos se pueden descargar en formato .sra. El SRA tiene un kit de software que permite convertir el formato sra en fastq o sff. Yo los exporte en formato fastq, usando el comando:

for i in $(ls *.sra); do name=`basename $i .sra`; fastq-dump -TR -W -F -SL -A $name $i; done

La opción tal vez mas importante en este comando es -W que remueve los extremos de baja calidad de las lecturas.

Uno de los primeros paso antes de continuar al ensamble de las lecturas es revisarla un poco, e.g., longitud, calidades. Este tipo de análisis se puede adelantar con FastQC.

Corrida (SRA accession)Número de LecturasRango de tamaños
SRR227300923701-119
SRR2273371222081-129
SRR227338967651-125
SRR2273392222751-131
SRR227340957501-129

La calidad es buena hasta la posición ~40, a partir de allí cae drasticamente. No muy sorprendente para este tipo de tecnologías. Las gráficas con similares para las otras 4 corridas. La siguiente figura corresponde a la distribución de calidad en todas las corridas (archivos fastq concatenados).

Sobre la longitud de las secuencias, la Figura de abajo, muestra que el PGM genera lecturas en un rango bastante estrecho, con un pico en 100bp.


Como podemos observar los datos generados por el PGM de Ion Torrent son lecturas de ADN de longitud corta. En general este tipo de datos se prestan muy bien para hacer ensambles de mapeo, pero no muy bien para ensambles de novo. A pesar de estoy yo estoy interesado en ver las posibilidades y las limitaciones de este tipo de datos para los ensambles de novo. Mas adelante les contaré los resultados de estos experimentos.

jueves, mayo 05, 2011

El genoma de Selaginella nos permite encontrar cambios en el contenido genético asociados con la evolución de las plantas vasculares

Acaba de salir publicado el artículo que describe el genoma de Selaginella moellendorfii. Tuve la oportunidad de participar en ese estudio y creo que es buena idea re-activar este espacio con un resumen corto.

Selaginella es una planta terreste y que cuenta con un sistema vascular verdadero.

Foto: Selaginella moellendorffii (Jing-Ke Weng, Salk University)

Las plantas que colonizaron el ambiente terrestre empezaron a divergir hace mas de 450 millones de años. Los principales linajes que existen actualmente, resultado de esa divergencia, son los musgos, los licófitos y las plantas con hojas verdaderas (helechos y plantas con semillas). Selaginella es un licófito.

Desde el año 2000 conocemos los genomas completos de varias angiospermas (plantas con flores), e.g., Arabidopsis thaliana (prima de la mostaza), Oryza sativa (arroz). Desde el 2008 conocemos el genoma completo del musgo Physcomitrella patens, lo que nos permitió proponer algunos rasgos moleculares importantes en la colonización del ambiente terrestre. Pero para conocer las características moleculares que llevaron al desarrollo de vasos de transporte reales de nutrientes en las plantas era necesario conocer el genoma de un licófito, como la Selaginella moellendorfii. El estudio de este organismo nos permitió inferir, a partir de la comparación con otras plantas, que el desarrollo del sistema vascular requirió de la evolución de 516 genes nuevos, y que el desarrolló de las semillas se vio facilitado por la innovación representada en 1350 genes más.

En el desarrollo de esta investigación participaron mas de 100 investigadores de 11 países alrededor del mundo. Este estudio fue liderado por la Dra. Jo Ann Banks de la Universidad de Purdue en Estados Unidos de América. La participación de Joint Genome Institute adscrito al Departamento de Energía de Estados Unidos de América, aseguró el éxito del trabajo.

En Colombia las especies del genero Selaginella se conocen como doradilla y se emplean principalmente como plantas ornamentales. En Colombia, se encuentra principalmente en los departamentos de Amazonas, Caquetá, Cuaca, Guainía, Guaviare, Meta, Nariño, Vaupés y Vichada.

jueves, julio 15, 2010

Sobre las bolas de pelos: ridiculogramas

Quien no ha visto una imagen de una red? de internet, de reguladores de transcripción o de interacción entre proteínas?



Imagen tomada de http://www.bordalierinstitute.com/images/yeastProteinInteractionNetwork.jpg

Hoy en día son muy comunes y llaman mucho la atención. De hecho, uno de mis intereses particulares es estudiar la topología de esas redes y ver como responden a las perturbaciones.

Sin embargo la típica representación visual como bolitas y palitos no es muy útil, por eso ahora se les llama en forma generalizada 'bolas de pelos', incluso M. E. J. Newman, un experto en análisis de redes, las llama 'ridiculogramas'.

Un ridiculograma tiene las siguientes características:

* visualmente deslumbrantes.
* Sin valor científico.
* Publicados en Science o Nature.

domingo, octubre 05, 2008

Factores de transcripción en las plantas

Este es el tema de mi tesis de doctorado y en estos momentos estoy preparando la presentación final de mi trabajo de los últimos 4 años. Buscando formas novedosas de visualizar algunos datos me encontré con Many Eyes, espectacular.

Aquí les dejos algunoas de los gráficos que creé del número de factores de transcripción por especie y por familia de factores.



viernes, septiembre 19, 2008

GCB 2008 - charlas sobresalientes

La semana que pasó estuve en Dresden asistiendo a la conferencia alemana de bioinformática. En general el nivel de las charlas fue muy bueno. Dos de las "keynotes" me parecieron excelentes, la de Trey Ideker y la de Michael Ashburner. La primera trató sobre biología de sistemas, y la segunda sobre el uso, pasado, presente y futuro de las ontologías en biología.

Les dejo una pequeña presentación en PDF con los principales puntos de las charlas.

miércoles, septiembre 10, 2008

GCB 2008 en Dresden

Esta semana se lleva acabo la conferencia alemana de bioinformática (GCB2008) en la hermosa ciudad de Dresden, los organizadores han escogido el museo alemán de la higiene como sede del evento.

Aquí les dejo una mujestra de una de las maravillas que se encuentran en las cercanías del museo.



Mas adelante habrá una entrada con un resumen de las presentaciones que mas me impactaron/interesaron. Hasta la próxima.

lunes, agosto 11, 2008

tesis: la frontera final

Estoy a punto de por fin entregar mi tesis de doctorado.

Luego de entregarla tengo que esperar approx. 2 meses por las evaluaciones de 4 expertos en mi área de trabajo. Si las evaluaciones recomiendan continuar con el proceso tendré que hacer una presentación pública de mi trabajo. Así que este apenas es el principio del final!

Mientras tanto aquí les dejo un representación gráfica de lo que hice en los últimos años.


La nube de palabras (word cloud) fue creada con Wordle

domingo, junio 01, 2008

Bio-números

De vez en cuando, en el marco de diferentes análisis es importante hacer referencia a diferentes propiedades numéricas de los organismos, como número de chromosomas, tamaño del genoma, número de tipos celulares, etc. Y siempre toma bastante tiempo encontrar las referencias primarias. Afortunadamente un equipo del departamento de biología de sistema en harvard, decidio crear una base de datos, Bionumbers, en la cual almacenar y hacer públicos esos datos, con referencias a los reportes originales.

Además, cualquiera, luego de registrarse, puede agregar nuevos números biológicos, siguiendo la misma filosofía de la wikipedia.

Así que, a agregar mas bio-números.

sábado, mayo 10, 2008

Factores de transcripción en Chlamydomonas

Siguiendo el ejemplo de Clastic Detritus y Green Gabbro, aquí va la nube de etiquetas (creada con TagCrowd) de uno de mis artículos recientes, que fue publicado en Genetics (Vol 179 No. 1, pp 31-39). Chlamydomonas es un alga verde, y el artículo trata de las familias de factores de transcripción es esta alga y otras plantas.

lunes, junio 04, 2007

Dinucleotide shuffle

Una de las estrategias comúnmente empleadas en el estudio de ARN no codificantes, es estimar la "energía mínima de plegamiento (MFE por sus siglas en inglés)" de la estructura secundaria del ARN candidato. Este enfoque se basa en el hecho de que en muchos ARN no codificantes la estructura secundaria de la molécula es importante para su desempeño en el sistema biológico.

Usualmente la MFE estimada se compara con la MFE de secuencias al azar derivadas por re-ordenamiento de la secuencia original de ARN ("nucleotide suffling"). La hipótesis subyacente es que ARN no codificantes funcionales tendrán una estructura secundaria más estable (con menor MFE) que la predicha para una secuencia al azar de la misma composición nucleótidica.

La hipótesis funcionaría bien si los programas de predicción de estructuras secundarias fuesen completamente independientes de los sesgos en el contenido se bases nucléotidicas en las secuencias. Desafortunadamente esto no ocurre. La predicción de estructuras secundarias se basa en observaciones experimentales de la energía libre de di-nucleótidos apilados, de forma que la composición de di-nucleótidos en la secuencia es un factor que tiene que ser controlado en el experimento computacional.

La forma de controlar por el efecto de la composición de di-nucleótidos es generando secuencias al azar en donde esta composición sea idéntica (de forma exacta o estadísticamente) a la de la secuencia original. De forma que si la MFE es realemente significativa, y no solo efecto del sesgo di-nucleótidico, esta será (estadísticamente) menor que la de la secuencia al azar.

La generación de secuencias al azar que conservan la composición de di-nucleótidos es un poco mas complicada que aquella en donde solo la composición de monómeros es preservada. En 1985 Altschul y Erickson desarrollaron un algoritmo para generar este tipo de secuencias aleatorias, del cual hay varias implementaciones. Una de ellas, en perl, esta disponible en MacResearch.

Así que no olvidar generar secuencias al azar que conserven la composición de di-nucleótidos cuando se analice la estabilidad de estructuras secundarias de ARN.

miércoles, marzo 21, 2007

OpenKapow

Conocí openkapow por un artículo en el blog de Pedro Beltrao, e inmediatamente decidí ensayarlo y ver que posibilidades brindaba.

Básicamente, openkapow sirve para reunir datos de diferentes sitios web en forma sistemática.

Yo tenía el siguiente poblema: necesitaba obtener la ubicacíon en el borrador del genoma de Chlamydomonas reinhardtii para cada uno de los factores de transcripción que aparecen en ChlamyTFDB.

La información sobre la ubicación en el genoma está en páginas web del JGI/DOE, y cada uno de los factores de transcripción en ChlamyTFDB tiene un hipervínculo a la página del JGI/DOE apropiada.

Claro, esta tarea se puede resolver usando, por ejemplo, scripts de PERL, pero eso significa una inversión significativa de tiempo, planenado, escribiendo y corrigiendo el script. Y aquí es donde openkapow nos ayuda.

Mediante una interface gráfica, Openkapow, permite construir paso a paso las acciones requeridas para navegar diferentes páginas, extraer datos usando el puntero del ratón y cliqueando, y exportar los datos a la web o archivos de texto locales en formato CSV, XML o HTML.

Creo que el único requisito para usar OpenKapow es poder estructurar el problema en forma programática, luego es aplicar la estructura en la interace de OpenKapow, incluso añadiendo control de errores, entrada de datos, y filtrado de resultados basado en expresiones regulares, si se desea.

En realidad me parece una excelente herramienta y se las recomiendo.

miércoles, noviembre 29, 2006

First Online EMBL PhD Symposium

Del 4 al 8 de Diciembre se llevará a cabo el primer simposio en línea del EMBL. Completamente gratis y los interesador en proveer contenido, ofrecer charlas, presentar "posters" son libres de hacerlo previo registro. Yo me enteré via el blog the Pedro Beltrao.

Hay tres ejes principales de presentaciones y discusión:
  1. Desarrollo de carreras en ciencias
  2. Biología de sistemas / ómicas
  3. Comunicación en ciencias 2.0
Adicionalmente abrá un "espacio" para que los diferentes participantes contribuyan con sus propias conferencias.

Sin lugar a dudas es un experimento interesante, realizar el encuentro en línea y completamente gratuito. Posiblemente sirva como un mecanismo adicional de popularización de la ciencia y de los retos y preguntas que siempre tenemos que abordar, así no sean propiamente científicos.

bueno, entocnes por "allá" nos vemos.

jueves, agosto 10, 2006

ISMB2006, Agosto 10: Conferencias

Último día en ISMB.

Empezamos el día con la magnífica conferencia magistral de Richard Roberts.

Inició su charla con una transparencia apoyando el acceso libre a la literatura científica (Open Access). Nos contó que ya no hace evaluaciones para revistas científicas que no hagan parte de este movimiento, ni tampoco hace parte de sus comités editoriales. Y sugirió obrar de similar manera.

El objetivo es que toda la literatura este públicamente disponible en línea, de esa forma podremos empezar a explotar todos esos datos y hacer, tal vez, descubrimientos biológicos. Muchos descubrimientos se han hecho tarde por falta de acceso a la literatura relevante. Esa es la primcipal motivación del movimiento.

A continuación, exhortó a la comunidad bioinformática a realizar verificaciones de sus predicciones computacionales. Parafraseándolo: "Nadie va a probar las predicciones hechas por alguién mas". Así que a colaborar mas con experimentalistas.

El siguiente punto que tocó fue su falta de confianza en la biología de sistemas. su razón: No estamos en un momento en que podamos realizar biología al nivel de sistemas en la forma enque está propuesta por que necesitamos todavía mucha mas información básica, bioquímica. Es cierto que tenemos a disposición largos listados de componentes celulares, pero hace falta conocer la(s) función(es) de la mayoría de estos componentes.

Junto a esto, menciona que es prácticamente criminal la cantidad de dinero que se viene invirtiendo en los proyectos de secuenciación, sin una inversión concomitante en proyectos de anotación.

La siguiente parte de su charla trató sobre su trabajo científico en New England Biolabs. Está compañia vende enzimas de restricción, así que sobre estas habló.

El punto mas interesante, que es el que consignaré aquí, fue sobre como de los datos de secuenciación de genomas (Whole genome shotgun sequencing, WGSS en adelante) todavía se pueden extraer ciertos hechos interesantes y biológicamente relevantes.

Las enzimas de restricción (ER, en adelante) se encuentran en bacteria y archaea, y cumplen la tarea de destruir ADN exógeno, reconociendo y cortando en secuencias cortas copn alta especificidad. Para evitar que las ER destruyan el ADN local, estos organismos tienen enzimas de modificación (EM), que generalmente metilan al ADN en las mismas secuencias de reconocimiento de las ER. En la mayoría de los casos ER y EM están codificadas de forma contigua en el genoma.

Que tiene que ver eso con WGSS?

Primero recordemos brevemente que es el WGSS. El genoma completo de un organismo se hace pedazos de forma aleatoria, y cada fragmento es clonado en una bacteria, usualmente Escherichia coli. Luego cada fragmento es secuenciado y en un último paso las secuencias de cada fragmentos se ensamblam para reconstruir el genoma inicial.

Ahora si, que tienen que ver ER y WGSS. Si uno de estos fragmentos generados al azar contiene la secuencia completa de una ER que no se encuentra nativamente en el organismo en el que se clona e.g. E. coli, es posible que esta enzima sea transcrita y traducida, y empiece a degradar el genoma, lo que terminará matando a la bacteria, por lo que será imposible recuperar clones que incluyan esos fragmentos. Por lo tanto habrá "gaps" en el mapa de clones del genoma. Esto fue lo que el grupo de Roberts buscó en los datos originales de secuenciación de Haemophilus influenzae, que eran mantenidos en el sotáno de TIGR en cinta magnética.

Ellos encontraron que había gaps en el mapa de clones, y que el gap era seguido por la secuencia de una enzima de modificación, tal y cual había sido predicho. Esto permitió descubrir nuevas ER, cuya función y actividad fue confirmada experimentalmente.

Bueno, esta fue la resumida bitácora de ISMB2006.

martes, agosto 08, 2006

ISMB2006, Agosto 8: Conferencias

En un nuevo día, capoeira:



La charla magistral de la mañana estuvo a cargo del famoso Michael Waterman, el mismo del algoritmo Smith-Waterman para el alineamiento de secuencias, por si acaso. El recibía el premio a "Senior scientist accomplishment".

Su charla estaba titulada "Whole Genome Optical Mapping", pero como afortunadamente siempre pasa con estos grandes hombres, nombres. La primera parte consistió en un poco de su historia en el área de biología computacional. Excelente y divertida. Referencias a su encuentro con Stan Ulam (Método de Monte Carlo) y luego con Temple Smith, con quién publicaría el artículo de alineamiento de secuencias. Y mas tarde con David Lipman )ahora director del NCBI, quién recibio este mismo premio en ISMB2004). Un par de referencias a artículos rechazados, artículos que luego serían el fundamento de mucho de lo que es hoy bioinformática. Una de las razones por las cuales los artículos fueron rechazados es que no existía un nicho para ese tipo de publicaciones. Y los artículos no eran ni de biología ni de matemáticas. Una referencia común poara todos aquellos que han iniciado un nuevo campo de investigación.

Luego de ese corto recuento histórico, habló sobre "whole genome optical mapping".

Luego vino la charla de Amos Bairoch (Swiss Prot), como parte del panel "Nuevas Fronteras", que trataba sobre financiación en bioinformática. El problema que plantea es la falta de financiación a largo plazo para manterner centros de datos. Su propuesta, que ambisiosamente quiere llamar "La declaración de Fortaleza", es crear una especie de impuesto para cada proyecto que genere grandes cantidades de datos que se tienen que mantener disponibles, accesibles y seguros a largo plazo. Este impuesto sería una parte del dinero otorgado para la financiación del proyecto.

Estas son algunas de las repsuestas del auditoria a la propuesta:


  • No todos los proyectos deben pagar lo mismo. Pequeños proyectos deben pagar muy poco o nada, mientras que grandesconsorcios pagarían mas.

  • En nuestra comunidad estamos acostrumbrados a compartir libre y públicamente los datos, pero no ocurre lo mismo en otros círculos. Así que se necesita educación en esa tema.

  • Es importante ofrecer servicios adicionales, que haya mayores incentivos para que grandes proyectos destinen parte de su financiación al manejo y mantenimiento de datos.



Esa es la propuesta de Amos, obviamente mucho camino que recorrer. Y veo difícil "sacarle" una "tajada" a los proyectos de investigación "solo" para mantener los datos disponibles, como se sugirió en la discusión parte del atractivo que hay que crear es ofrecer servicios adicionales, cuales?, esa es la pregunta.

Aclaro, en este blog solo aparecerán comentarios/resúmenes sobre las charlas que no aparecen en el número especial de Bioinformatics. Así que, hasta mañana.

ISMB2006, Agosto 7: Conferencias

Hoy comenzó oficialmente el evento, y nada mejor que un poco de folclor brasilero para motivarnos.



Ahora si sobre algunas charlas. Hubo una demostración de software del EBI, presentando EBIMed, otra herramienta (ver entrada de ayer) para la explotación de textos en MEDLINE.

Luego tuvimos un par de charlas, parte del panel coordinado por Goran Neshich de Embrapa, sobre "Nuevas fronteras en Bioinformática y Biología Computacional". Que retos enfrentaremos en los próximos 10 años.

La primera charla estuvo a cargo de Janet Thornton, e insistía en que los nuevos retos de la bioinformática yacen en la transferencia de información y tecnologías hacia los campos de medicina y agricultura. Parte del reto está en el manejo de nuevos tipos de datos, como radiografias, pruebas clínicas, etc. Otra parte del reto es cumplir a las farmaceúticas en el desarrollo de nuevas drogas, mucho se especulo sobre esto con la secuenciación de genomas, pero hasta ahora poco ha resultado.

En resumén, según Janet, necesitamos:

-Aumento en educación en bioinformática.
-Modelos predictivos.
-Infraestructura bioinformática para la investigación clinica.
-Entender las bases moleculares de las enfermedades.

Y uno de los principales problemas a los que nos veremos enfrentados es que gran parte d elos datos son privados/protegidos, o por patentes o debido a la relación de confidencialidad paciente/doctor.

La segunda charla, ofrecida por Chris Sander. Una excelente y provocativa charla. Aquí están los siete puntos que según Chris constituyen los retos a los que nos veremos enfrentados en los próximos 10 años:


  1. Making biological function computable.

  2. Better quantitative models of evolution.

  3. Models of cellular decision process.

  4. Synthetic biology, nanotech and systems design.

  5. Neurobiology: From molecules to thinking.

  6. Genetic and somatic variations in humans.

  7. Close the gap between experiments and computation.

  8. Inform the public.



Esas fueron las sesiones mas provocativas del día.

domingo, agosto 06, 2006

ISMB2006, Agosto 6: Tutoriales

Hoy comenzó para mí la conferencia.

Asistí a dos tutoriales uno en la mañana (Biological literature mining: from information retrieval to biological discovery) y otro en la tarde (Bayesian networks for bioinformatics: an introduction to inference and learning).

El primero trataba sobre como usar la literatura existente (principalmente resúmenes de artículos en MEDLINE, con opción de textos completos disponibles en PUBMED Central) para hacer descubrimientos/hipótesis de carácter biólogico. Entre los problemas/retos mencionados, está el de identificar las entidades interesantes, nombres de gene/proteínas por ejemplo. Parte del problema radica en que algunas veces esas entidades reciben nombres no muy inteligentes, desde el punto de vista de la explotación de textos, como la proteína THE, o SDS. La primera un artículo muy común en inglés y la segunda un reactivo común en la preparación de geles. Otro problema mencionado radica en la ambiguedad de algunos términos. Ciertas entidades pueden usarse con diferentes significados. Al parecer la única solución a este problema en el momento es la participación de un experto humano. A pesar de los problemas que se mencionaron, está área es muy prometedora, la razón más clara, que fue mencionada en el turtorial, es que la cantidad de literatura disponible es tan grande que nadie es capaz de leerla toda, ni siquiera en un campo especializado, y por lo tanto conexiones entre hechos aislados pueden pasar desapercibidas. Las técnicas de explotación de textos (literature mining) pueden solucionar esto en gran medida, solo es cuestión de que se empiecen a usar mas. Una de las herramientas para el usuario final que más me intereso fue iHOP.

El segundo tutorial al que asistí trataba sobre redes bayesianas: cómo inferir sus parametros, la estructura y las relaciones causales (dirección de las aristas) a partir de datos. El principal problema es la inferencia de las relaciones causales, para lo cual se necesitan experimentos "bien pensados" en el laboratorio. Lo que de alguna forma le resta eficiencia (high-throughput).

Por hoy eso fue todo. Mañana tenemos las conferencias.

miércoles, agosto 02, 2006

ISMB2006 en Fortaleza, Brasil

El próximo fin de semana comienza ISMB, una de las reuniones mas grandes de bioinformática que hay. Allí presentaré un póster sobre mi trabajo con factores de transcripción en plantas. el objetivo es hacer la presentación en sociedad de las bases de datos que creé (copia del póster).

Espero publicar la próxima semana algunas entradas sobre la conferencia, ya veremos.

sábado, octubre 08, 2005

Charla en el MPI 05.10.2005

El pasado miércoles 5 de octubre el Profesor Dmitrij Frishman de la Universidad Técnica de Munich ofreció una charla en el MPI de Fisiología Molecular de Plantas (Golm, Alemania) titulada "Understanding protein-protein interactions by comparative genome analysis".

El principal objetivo de la charla fue presentar DIMA (Domain Interaction MAp). La idea de esta aplicación es predecir interacciones entre proteínas tomando como punto de partida los perfiles filogenéticos(phylogenetic profiles) de los dominios que se encuentran presentes en estas proteínas.

Es importante aclarar que la definición de "interacción" utilizada por los desarrolladores de DIMA, incluye tanto las interacciones funcionales como las físicas.

Los conceptos en los que se fundamenta esta aplicacion son los siguientes:

  • Un proteína(dominio) que participa en alguna interacción tiende a ser conservada(o)
  • El par que interactúa tiene una mayor probabilidad de ser conservado en diferentes genomas.
La principal ventaja del sistema es la rapidez con que se puede actualizar cuando se adicionan nuevas proteínas. El desarrollo de DIMA se motivó en STRING, una aplicación similar pero basada en la predicción de ortólogos en función de la similaridad entre secuencias de proteínas. Los esudios realizados hasta el momento han mostrado que el sobrelapamiento entre DIMA y STRING es bastante reducido, lo que sugiere su complementariedad.

¿Cómo funciona?

El concepto es muy sencillo, basado, como ya lo mencione, en los perfiles filogenéticos de dominios de proteinas.
Es necesario contar con el conjuto completo de proteínas de diferentes genomas.
Los dominios presentes en estas proteínas pueden ser encontrados utilizando diferentes estrategias, entre ellas, posiblemente la mejor, está PFAM.
Una vez los dominios se han localizado, se procede a crear una matriz de presencia/ausencia. Cada fila corresponde a un genoma, y cada columna a un dominio particular. Una celda corresponde a la presencia de un dominio dado en un genoma particular, y puede tomar uno de dos valores, 1 si el dominio se encuentra presente en ese genoma, o, 0 en caso contrario.

El conjuto de 0s y 1s para un dominio, recibe el nombre de "cadena de bits" (bit string)

El siguiente paso es el cálculo de alguna medida de distancia entre dominios. Generalmente se aplica un filtro antes del cómüputo de la similaridad, con el objetivo de eliminar aquellos dominos con bajo contenido de información (de acuerdo a la definión de información de Shannon), de esta forma aquellos dominios ubicuos y aquellos exclusivos de un solo genoma son eliminados.

La evaluación de similaridad permite agrupar a los dominios, los dominios pertenecientes a un grupo corresponden a las predicciones de dominos que interactúan. Estos grupos de dominios se mapean en alguno de los genomas de interés, el resultado es la predicción de interacciones entre proteínas en el genoma deseado.

El grupo del Prof. Frishman ha probado esta aplicación con el genoma de Saccharomyces cerevisiae, con resultados prometedores, aquí pueden obtener mayor información.

Además de la predicción de interacciones, uno podría usar DIMA para predecir ortólogos que tengan poca similaridad a nivel de secuencia. Por ejemplo, supongamos que se tiene un par de proteínas homólogas, cuya similiridad es muy baja, pero que aún conservan un estructura (arquitectura) de dominios muy similar.
Tratar de definir la homología entre este par de proteínas es muy difícil utilizando herramientas comunes como el BLAST recíproco, en cambio empleando DIMA, o alguna variante que se apoye en los mismo conceptos, se podría "fácilmente" inferir que las dos proteínas son efectivamente homólogas.

En resumen, DIMA es una herramienta que ofrece hipótesis sobre interacciones entre proteínas, que pueden ser directamente probadas en el laboratorio.