Este es el tema de mi tesis de doctorado y en estos momentos estoy preparando la presentación final de mi trabajo de los últimos 4 años. Buscando formas novedosas de visualizar algunos datos me encontré con Many Eyes, espectacular.
Aquí les dejos algunoas de los gráficos que creé del número de factores de transcripción por especie y por familia de factores.
domingo, octubre 05, 2008
viernes, septiembre 19, 2008
GCB 2008 - charlas sobresalientes
La semana que pasó estuve en Dresden asistiendo a la conferencia alemana de bioinformática. En general el nivel de las charlas fue muy bueno. Dos de las "keynotes" me parecieron excelentes, la de Trey Ideker y la de Michael Ashburner. La primera trató sobre biología de sistemas, y la segunda sobre el uso, pasado, presente y futuro de las ontologías en biología.
Les dejo una pequeña presentación en PDF con los principales puntos de las charlas.
Les dejo una pequeña presentación en PDF con los principales puntos de las charlas.
Etiquetas:
bioinformática,
biología de sistemas,
conferencias,
dresden,
gcb,
ontologías
miércoles, septiembre 10, 2008
GCB 2008 en Dresden
Esta semana se lleva acabo la conferencia alemana de bioinformática (GCB2008) en la hermosa ciudad de Dresden, los organizadores han escogido el museo alemán de la higiene como sede del evento.
Aquí les dejo una mujestra de una de las maravillas que se encuentran en las cercanías del museo.

Mas adelante habrá una entrada con un resumen de las presentaciones que mas me impactaron/interesaron. Hasta la próxima.
Aquí les dejo una mujestra de una de las maravillas que se encuentran en las cercanías del museo.
Mas adelante habrá una entrada con un resumen de las presentaciones que mas me impactaron/interesaron. Hasta la próxima.
Etiquetas:
bioinformática,
conferencias,
dresden,
gcb
martes, septiembre 02, 2008
Evolución de las plantas I
Las plantas son organismos eucarióticos fotosintéticos, lo que quiere decir que 'fabrican' los materiales que necesitan para vivir a partir de agua, dióxido de carbono y luz solar.
Las plantas aparecen en la tierra aproximadamente hace 1.400 millones de años, cuando una célula eucariótica que se alimentaba de cianobacterias (bacterias con la capacidad de hacer fotosíntesis), no digirió a la bacteria sino que la mantuvo intacta en su citoplasma. Con el tiempo y las generaciones esta bacteria se convirtió en un simbionte, que fue reduciendo de tamaño y pasó a depender completamente del organismo hospedero, convirtiéndose de hecho en un organelo de este, el cloroplasto, que es el organelo en donde tiene lugar la fotosíntesis. Este proceso se conoce como endosimbiosis, y ha ocurrido varias veces a lo largo de la evolución.
La siguente figura resume las relaciones evolutivas de los principales grupos de plantas existentes hoy en día. De la endosimbiosis original hace mas de 1.400 millones de años se derivaron tres grupos principales, las glaucofitas, las algas rojas (rhodophyta) y las plantas verdes (Chloroplastida). La inmensa mayoría de las plantas que conocemos y que están en nuestras casas son de este último tipo.

Ya vendrá mas información relacionada con la evolución de estos maravillosos organismos.
Las plantas aparecen en la tierra aproximadamente hace 1.400 millones de años, cuando una célula eucariótica que se alimentaba de cianobacterias (bacterias con la capacidad de hacer fotosíntesis), no digirió a la bacteria sino que la mantuvo intacta en su citoplasma. Con el tiempo y las generaciones esta bacteria se convirtió en un simbionte, que fue reduciendo de tamaño y pasó a depender completamente del organismo hospedero, convirtiéndose de hecho en un organelo de este, el cloroplasto, que es el organelo en donde tiene lugar la fotosíntesis. Este proceso se conoce como endosimbiosis, y ha ocurrido varias veces a lo largo de la evolución.
La siguente figura resume las relaciones evolutivas de los principales grupos de plantas existentes hoy en día. De la endosimbiosis original hace mas de 1.400 millones de años se derivaron tres grupos principales, las glaucofitas, las algas rojas (rhodophyta) y las plantas verdes (Chloroplastida). La inmensa mayoría de las plantas que conocemos y que están en nuestras casas son de este último tipo.

Ya vendrá mas información relacionada con la evolución de estos maravillosos organismos.
lunes, agosto 11, 2008
tesis: la frontera final
Estoy a punto de por fin entregar mi tesis de doctorado.
Luego de entregarla tengo que esperar approx. 2 meses por las evaluaciones de 4 expertos en mi área de trabajo. Si las evaluaciones recomiendan continuar con el proceso tendré que hacer una presentación pública de mi trabajo. Así que este apenas es el principio del final!
Mientras tanto aquí les dejo un representación gráfica de lo que hice en los últimos años.

La nube de palabras (word cloud) fue creada con Wordle
Luego de entregarla tengo que esperar approx. 2 meses por las evaluaciones de 4 expertos en mi área de trabajo. Si las evaluaciones recomiendan continuar con el proceso tendré que hacer una presentación pública de mi trabajo. Así que este apenas es el principio del final!
Mientras tanto aquí les dejo un representación gráfica de lo que hice en los últimos años.

La nube de palabras (word cloud) fue creada con Wordle
Etiquetas:
bioinformática,
evolución,
factores de transcripción,
tesis
domingo, junio 01, 2008
Bio-números
De vez en cuando, en el marco de diferentes análisis es importante hacer referencia a diferentes propiedades numéricas de los organismos, como número de chromosomas, tamaño del genoma, número de tipos celulares, etc. Y siempre toma bastante tiempo encontrar las referencias primarias. Afortunadamente un equipo del departamento de biología de sistema en harvard, decidio crear una base de datos, Bionumbers, en la cual almacenar y hacer públicos esos datos, con referencias a los reportes originales.
Además, cualquiera, luego de registrarse, puede agregar nuevos números biológicos, siguiendo la misma filosofía de la wikipedia.
Así que, a agregar mas bio-números.
Además, cualquiera, luego de registrarse, puede agregar nuevos números biológicos, siguiendo la misma filosofía de la wikipedia.
Así que, a agregar mas bio-números.
Etiquetas:
bases de datos,
bioinformática
martes, mayo 13, 2008
Albert Einstein on Religions from a letter to Jewish philosopher Eric Gutkind
Palabras de Don Albert Einstein sobre sus creencias religiosas:"The word god is for me nothing more than the expression and product of human weaknesses, the Bible a collection of honourable, but still primitive legends which are nevertheless pretty childish. No interpretation no matter how subtle can (for me) change this."
Mayor información: The Guardian and The Guardian
sábado, mayo 10, 2008
Factores de transcripción bZIPs en plantas - Nube de etiquetas
Tenemos que un artículo sobre la familia de factores de transcripción bZIP, que acabamos de enviar a PLoS ONE, en segunda vuelta. (actualización: artículo publicado el 12.08.08)
Aquí está la nube de etiquetas para que se haganuna idea de que trata el artículo.
Aquí está la nube de etiquetas para que se haganuna idea de que trata el artículo.
Etiquetas:
algas,
ancestrales,
bZIPs,
evolución,
factores de transcripción,
funciones,
plantas,
verdes
Factores de transcripción en Chlamydomonas
Siguiendo el ejemplo de Clastic Detritus y Green Gabbro, aquí va la nube de etiquetas (creada con TagCrowd) de uno de mis artículos recientes, que fue publicado en Genetics (Vol 179 No. 1, pp 31-39). Chlamydomonas es un alga verde, y el artículo trata de las familias de factores de transcripción es esta alga y otras plantas.
Etiquetas:
algas,
bioinformática,
evolución,
factores de transcripción,
funciones,
networks,
plantas,
regulación,
verdes
martes, marzo 25, 2008
Las cinco emociones de estar escribiendo la tesis
Corto y al punto:
Desesperanza, frustración, irritabilidad, alivio, robot.
Buena entrada en Green Gabbro
Desesperanza, frustración, irritabilidad, alivio, robot.
Buena entrada en Green Gabbro
Etiquetas:
blog,
doctorado,
escribir,
green gabbro,
tesis
lunes, junio 04, 2007
Dinucleotide shuffle
Una de las estrategias comúnmente empleadas en el estudio de ARN no codificantes, es estimar la "energía mínima de plegamiento (MFE por sus siglas en inglés)" de la estructura secundaria del ARN candidato. Este enfoque se basa en el hecho de que en muchos ARN no codificantes la estructura secundaria de la molécula es importante para su desempeño en el sistema biológico.
Usualmente la MFE estimada se compara con la MFE de secuencias al azar derivadas por re-ordenamiento de la secuencia original de ARN ("nucleotide suffling"). La hipótesis subyacente es que ARN no codificantes funcionales tendrán una estructura secundaria más estable (con menor MFE) que la predicha para una secuencia al azar de la misma composición nucleótidica.
La hipótesis funcionaría bien si los programas de predicción de estructuras secundarias fuesen completamente independientes de los sesgos en el contenido se bases nucléotidicas en las secuencias. Desafortunadamente esto no ocurre. La predicción de estructuras secundarias se basa en observaciones experimentales de la energía libre de di-nucleótidos apilados, de forma que la composición de di-nucleótidos en la secuencia es un factor que tiene que ser controlado en el experimento computacional.
La forma de controlar por el efecto de la composición de di-nucleótidos es generando secuencias al azar en donde esta composición sea idéntica (de forma exacta o estadísticamente) a la de la secuencia original. De forma que si la MFE es realemente significativa, y no solo efecto del sesgo di-nucleótidico, esta será (estadísticamente) menor que la de la secuencia al azar.
La generación de secuencias al azar que conservan la composición de di-nucleótidos es un poco mas complicada que aquella en donde solo la composición de monómeros es preservada. En 1985 Altschul y Erickson desarrollaron un algoritmo para generar este tipo de secuencias aleatorias, del cual hay varias implementaciones. Una de ellas, en perl, esta disponible en MacResearch.
Así que no olvidar generar secuencias al azar que conserven la composición de di-nucleótidos cuando se analice la estabilidad de estructuras secundarias de ARN.
Usualmente la MFE estimada se compara con la MFE de secuencias al azar derivadas por re-ordenamiento de la secuencia original de ARN ("nucleotide suffling"). La hipótesis subyacente es que ARN no codificantes funcionales tendrán una estructura secundaria más estable (con menor MFE) que la predicha para una secuencia al azar de la misma composición nucleótidica.
La hipótesis funcionaría bien si los programas de predicción de estructuras secundarias fuesen completamente independientes de los sesgos en el contenido se bases nucléotidicas en las secuencias. Desafortunadamente esto no ocurre. La predicción de estructuras secundarias se basa en observaciones experimentales de la energía libre de di-nucleótidos apilados, de forma que la composición de di-nucleótidos en la secuencia es un factor que tiene que ser controlado en el experimento computacional.
La forma de controlar por el efecto de la composición de di-nucleótidos es generando secuencias al azar en donde esta composición sea idéntica (de forma exacta o estadísticamente) a la de la secuencia original. De forma que si la MFE es realemente significativa, y no solo efecto del sesgo di-nucleótidico, esta será (estadísticamente) menor que la de la secuencia al azar.
La generación de secuencias al azar que conservan la composición de di-nucleótidos es un poco mas complicada que aquella en donde solo la composición de monómeros es preservada. En 1985 Altschul y Erickson desarrollaron un algoritmo para generar este tipo de secuencias aleatorias, del cual hay varias implementaciones. Una de ellas, en perl, esta disponible en MacResearch.
Así que no olvidar generar secuencias al azar que conserven la composición de di-nucleótidos cuando se analice la estabilidad de estructuras secundarias de ARN.
Etiquetas:
bioinformática,
dinucleotide,
estructura secundaria,
programación,
rna,
shuffle
miércoles, marzo 21, 2007
OpenKapow
Conocí openkapow por un artículo en el blog de Pedro Beltrao, e inmediatamente decidí ensayarlo y ver que posibilidades brindaba.
Básicamente, openkapow sirve para reunir datos de diferentes sitios web en forma sistemática.
Yo tenía el siguiente poblema: necesitaba obtener la ubicacíon en el borrador del genoma de Chlamydomonas reinhardtii para cada uno de los factores de transcripción que aparecen en ChlamyTFDB.
La información sobre la ubicación en el genoma está en páginas web del JGI/DOE, y cada uno de los factores de transcripción en ChlamyTFDB tiene un hipervínculo a la página del JGI/DOE apropiada.
Claro, esta tarea se puede resolver usando, por ejemplo, scripts de PERL, pero eso significa una inversión significativa de tiempo, planenado, escribiendo y corrigiendo el script. Y aquí es donde openkapow nos ayuda.
Mediante una interface gráfica, Openkapow, permite construir paso a paso las acciones requeridas para navegar diferentes páginas, extraer datos usando el puntero del ratón y cliqueando, y exportar los datos a la web o archivos de texto locales en formato CSV, XML o HTML.
Creo que el único requisito para usar OpenKapow es poder estructurar el problema en forma programática, luego es aplicar la estructura en la interace de OpenKapow, incluso añadiendo control de errores, entrada de datos, y filtrado de resultados basado en expresiones regulares, si se desea.
En realidad me parece una excelente herramienta y se las recomiendo.
Básicamente, openkapow sirve para reunir datos de diferentes sitios web en forma sistemática.
Yo tenía el siguiente poblema: necesitaba obtener la ubicacíon en el borrador del genoma de Chlamydomonas reinhardtii para cada uno de los factores de transcripción que aparecen en ChlamyTFDB.
La información sobre la ubicación en el genoma está en páginas web del JGI/DOE, y cada uno de los factores de transcripción en ChlamyTFDB tiene un hipervínculo a la página del JGI/DOE apropiada.
Claro, esta tarea se puede resolver usando, por ejemplo, scripts de PERL, pero eso significa una inversión significativa de tiempo, planenado, escribiendo y corrigiendo el script. Y aquí es donde openkapow nos ayuda.
Mediante una interface gráfica, Openkapow, permite construir paso a paso las acciones requeridas para navegar diferentes páginas, extraer datos usando el puntero del ratón y cliqueando, y exportar los datos a la web o archivos de texto locales en formato CSV, XML o HTML.
Creo que el único requisito para usar OpenKapow es poder estructurar el problema en forma programática, luego es aplicar la estructura en la interace de OpenKapow, incluso añadiendo control de errores, entrada de datos, y filtrado de resultados basado en expresiones regulares, si se desea.
En realidad me parece una excelente herramienta y se las recomiendo.
jueves, febrero 08, 2007
Propaganda PlnTFDB
Después de 4 meses de estar incapacitado, por un problema con mi pierna derecha, vuelvo a la universidad. Claro, esos 4 meses no fueron perdida completa. Salió un artículo presentando la base de datos de factores de transcripción en plantas (PlnTFDB: Plant Transcription Factor Database) que hemos creado.
Decidimos publicar el artíclo en BMC Bioinformatics, una revista de acceso abierto (Open Access, OA). Sobre el modelo de OA, solo ventajas. Primero, el artículo está disponible en internet para todo aquel que este interesado en leerlo, es posible redistribuirlo libremente, y crear trabajos derivados siempre y cuando la fuente original se referencie apropiadamente. En segundo lugar, el tiempo total desde que se envió el artículo por primera vez a la revista hasta que fue publicado en línea, fue de 47 días. Los comentarios y sugerencias de los evaluadores anónimos fueron en verdad de ayuda para mejorar la calidad del artículo y presentar un mensaje mas claro, y en algunos casos mejorar la base de datos en línea.
Lo que viene ahora es extender la base de datos, principalmente agregar datos experimentales sobre los factores de transcripción que hemos predicho.
Decidimos publicar el artíclo en BMC Bioinformatics, una revista de acceso abierto (Open Access, OA). Sobre el modelo de OA, solo ventajas. Primero, el artículo está disponible en internet para todo aquel que este interesado en leerlo, es posible redistribuirlo libremente, y crear trabajos derivados siempre y cuando la fuente original se referencie apropiadamente. En segundo lugar, el tiempo total desde que se envió el artículo por primera vez a la revista hasta que fue publicado en línea, fue de 47 días. Los comentarios y sugerencias de los evaluadores anónimos fueron en verdad de ayuda para mejorar la calidad del artículo y presentar un mensaje mas claro, y en algunos casos mejorar la base de datos en línea.
Lo que viene ahora es extender la base de datos, principalmente agregar datos experimentales sobre los factores de transcripción que hemos predicho.
Etiquetas:
factores de transcripción,
plntfdb
miércoles, noviembre 29, 2006
First Online EMBL PhD Symposium
Del 4 al 8 de Diciembre se llevará a cabo el primer simposio en línea del EMBL. Completamente gratis y los interesador en proveer contenido, ofrecer charlas, presentar "posters" son libres de hacerlo previo registro. Yo me enteré via el blog the Pedro Beltrao.
Hay tres ejes principales de presentaciones y discusión:
Sin lugar a dudas es un experimento interesante, realizar el encuentro en línea y completamente gratuito. Posiblemente sirva como un mecanismo adicional de popularización de la ciencia y de los retos y preguntas que siempre tenemos que abordar, así no sean propiamente científicos.
bueno, entocnes por "allá" nos vemos.
Hay tres ejes principales de presentaciones y discusión:
- Desarrollo de carreras en ciencias
- Biología de sistemas / ómicas
- Comunicación en ciencias 2.0
Sin lugar a dudas es un experimento interesante, realizar el encuentro en línea y completamente gratuito. Posiblemente sirva como un mecanismo adicional de popularización de la ciencia y de los retos y preguntas que siempre tenemos que abordar, así no sean propiamente científicos.
bueno, entocnes por "allá" nos vemos.
Etiquetas:
bioinformática,
EMBL,
encuentro
jueves, agosto 10, 2006
ISMB2006, Agosto 10: Conferencias
Último día en ISMB.
Empezamos el día con la magnífica conferencia magistral de Richard Roberts.
Inició su charla con una transparencia apoyando el acceso libre a la literatura científica (Open Access). Nos contó que ya no hace evaluaciones para revistas científicas que no hagan parte de este movimiento, ni tampoco hace parte de sus comités editoriales. Y sugirió obrar de similar manera.
El objetivo es que toda la literatura este públicamente disponible en línea, de esa forma podremos empezar a explotar todos esos datos y hacer, tal vez, descubrimientos biológicos. Muchos descubrimientos se han hecho tarde por falta de acceso a la literatura relevante. Esa es la primcipal motivación del movimiento.
A continuación, exhortó a la comunidad bioinformática a realizar verificaciones de sus predicciones computacionales. Parafraseándolo: "Nadie va a probar las predicciones hechas por alguién mas". Así que a colaborar mas con experimentalistas.
El siguiente punto que tocó fue su falta de confianza en la biología de sistemas. su razón: No estamos en un momento en que podamos realizar biología al nivel de sistemas en la forma enque está propuesta por que necesitamos todavía mucha mas información básica, bioquímica. Es cierto que tenemos a disposición largos listados de componentes celulares, pero hace falta conocer la(s) función(es) de la mayoría de estos componentes.
Junto a esto, menciona que es prácticamente criminal la cantidad de dinero que se viene invirtiendo en los proyectos de secuenciación, sin una inversión concomitante en proyectos de anotación.
La siguiente parte de su charla trató sobre su trabajo científico en New England Biolabs. Está compañia vende enzimas de restricción, así que sobre estas habló.
El punto mas interesante, que es el que consignaré aquí, fue sobre como de los datos de secuenciación de genomas (Whole genome shotgun sequencing, WGSS en adelante) todavía se pueden extraer ciertos hechos interesantes y biológicamente relevantes.
Las enzimas de restricción (ER, en adelante) se encuentran en bacteria y archaea, y cumplen la tarea de destruir ADN exógeno, reconociendo y cortando en secuencias cortas copn alta especificidad. Para evitar que las ER destruyan el ADN local, estos organismos tienen enzimas de modificación (EM), que generalmente metilan al ADN en las mismas secuencias de reconocimiento de las ER. En la mayoría de los casos ER y EM están codificadas de forma contigua en el genoma.
Que tiene que ver eso con WGSS?
Primero recordemos brevemente que es el WGSS. El genoma completo de un organismo se hace pedazos de forma aleatoria, y cada fragmento es clonado en una bacteria, usualmente Escherichia coli. Luego cada fragmento es secuenciado y en un último paso las secuencias de cada fragmentos se ensamblam para reconstruir el genoma inicial.
Ahora si, que tienen que ver ER y WGSS. Si uno de estos fragmentos generados al azar contiene la secuencia completa de una ER que no se encuentra nativamente en el organismo en el que se clona e.g. E. coli, es posible que esta enzima sea transcrita y traducida, y empiece a degradar el genoma, lo que terminará matando a la bacteria, por lo que será imposible recuperar clones que incluyan esos fragmentos. Por lo tanto habrá "gaps" en el mapa de clones del genoma. Esto fue lo que el grupo de Roberts buscó en los datos originales de secuenciación de Haemophilus influenzae, que eran mantenidos en el sotáno de TIGR en cinta magnética.
Ellos encontraron que había gaps en el mapa de clones, y que el gap era seguido por la secuencia de una enzima de modificación, tal y cual había sido predicho. Esto permitió descubrir nuevas ER, cuya función y actividad fue confirmada experimentalmente.
Bueno, esta fue la resumida bitácora de ISMB2006.
Empezamos el día con la magnífica conferencia magistral de Richard Roberts.
Inició su charla con una transparencia apoyando el acceso libre a la literatura científica (Open Access). Nos contó que ya no hace evaluaciones para revistas científicas que no hagan parte de este movimiento, ni tampoco hace parte de sus comités editoriales. Y sugirió obrar de similar manera.
El objetivo es que toda la literatura este públicamente disponible en línea, de esa forma podremos empezar a explotar todos esos datos y hacer, tal vez, descubrimientos biológicos. Muchos descubrimientos se han hecho tarde por falta de acceso a la literatura relevante. Esa es la primcipal motivación del movimiento.
A continuación, exhortó a la comunidad bioinformática a realizar verificaciones de sus predicciones computacionales. Parafraseándolo: "Nadie va a probar las predicciones hechas por alguién mas". Así que a colaborar mas con experimentalistas.
El siguiente punto que tocó fue su falta de confianza en la biología de sistemas. su razón: No estamos en un momento en que podamos realizar biología al nivel de sistemas en la forma enque está propuesta por que necesitamos todavía mucha mas información básica, bioquímica. Es cierto que tenemos a disposición largos listados de componentes celulares, pero hace falta conocer la(s) función(es) de la mayoría de estos componentes.
Junto a esto, menciona que es prácticamente criminal la cantidad de dinero que se viene invirtiendo en los proyectos de secuenciación, sin una inversión concomitante en proyectos de anotación.
La siguiente parte de su charla trató sobre su trabajo científico en New England Biolabs. Está compañia vende enzimas de restricción, así que sobre estas habló.
El punto mas interesante, que es el que consignaré aquí, fue sobre como de los datos de secuenciación de genomas (Whole genome shotgun sequencing, WGSS en adelante) todavía se pueden extraer ciertos hechos interesantes y biológicamente relevantes.
Las enzimas de restricción (ER, en adelante) se encuentran en bacteria y archaea, y cumplen la tarea de destruir ADN exógeno, reconociendo y cortando en secuencias cortas copn alta especificidad. Para evitar que las ER destruyan el ADN local, estos organismos tienen enzimas de modificación (EM), que generalmente metilan al ADN en las mismas secuencias de reconocimiento de las ER. En la mayoría de los casos ER y EM están codificadas de forma contigua en el genoma.
Que tiene que ver eso con WGSS?
Primero recordemos brevemente que es el WGSS. El genoma completo de un organismo se hace pedazos de forma aleatoria, y cada fragmento es clonado en una bacteria, usualmente Escherichia coli. Luego cada fragmento es secuenciado y en un último paso las secuencias de cada fragmentos se ensamblam para reconstruir el genoma inicial.
Ahora si, que tienen que ver ER y WGSS. Si uno de estos fragmentos generados al azar contiene la secuencia completa de una ER que no se encuentra nativamente en el organismo en el que se clona e.g. E. coli, es posible que esta enzima sea transcrita y traducida, y empiece a degradar el genoma, lo que terminará matando a la bacteria, por lo que será imposible recuperar clones que incluyan esos fragmentos. Por lo tanto habrá "gaps" en el mapa de clones del genoma. Esto fue lo que el grupo de Roberts buscó en los datos originales de secuenciación de Haemophilus influenzae, que eran mantenidos en el sotáno de TIGR en cinta magnética.
Ellos encontraron que había gaps en el mapa de clones, y que el gap era seguido por la secuencia de una enzima de modificación, tal y cual había sido predicho. Esto permitió descubrir nuevas ER, cuya función y actividad fue confirmada experimentalmente.
Bueno, esta fue la resumida bitácora de ISMB2006.
Etiquetas:
bioinformática,
conferencias,
ISMB,
open access
martes, agosto 08, 2006
ISMB2006, Agosto 8: Conferencias
En un nuevo día, capoeira:
La charla magistral de la mañana estuvo a cargo del famoso Michael Waterman, el mismo del algoritmo Smith-Waterman para el alineamiento de secuencias, por si acaso. El recibía el premio a "Senior scientist accomplishment".
Su charla estaba titulada "Whole Genome Optical Mapping", pero como afortunadamente siempre pasa con estos grandes hombres, nombres. La primera parte consistió en un poco de su historia en el área de biología computacional. Excelente y divertida. Referencias a su encuentro con Stan Ulam (Método de Monte Carlo) y luego con Temple Smith, con quién publicaría el artículo de alineamiento de secuencias. Y mas tarde con David Lipman )ahora director del NCBI, quién recibio este mismo premio en ISMB2004). Un par de referencias a artículos rechazados, artículos que luego serían el fundamento de mucho de lo que es hoy bioinformática. Una de las razones por las cuales los artículos fueron rechazados es que no existía un nicho para ese tipo de publicaciones. Y los artículos no eran ni de biología ni de matemáticas. Una referencia común poara todos aquellos que han iniciado un nuevo campo de investigación.
Luego de ese corto recuento histórico, habló sobre "whole genome optical mapping".
Luego vino la charla de Amos Bairoch (Swiss Prot), como parte del panel "Nuevas Fronteras", que trataba sobre financiación en bioinformática. El problema que plantea es la falta de financiación a largo plazo para manterner centros de datos. Su propuesta, que ambisiosamente quiere llamar "La declaración de Fortaleza", es crear una especie de impuesto para cada proyecto que genere grandes cantidades de datos que se tienen que mantener disponibles, accesibles y seguros a largo plazo. Este impuesto sería una parte del dinero otorgado para la financiación del proyecto.
Estas son algunas de las repsuestas del auditoria a la propuesta:
Esa es la propuesta de Amos, obviamente mucho camino que recorrer. Y veo difícil "sacarle" una "tajada" a los proyectos de investigación "solo" para mantener los datos disponibles, como se sugirió en la discusión parte del atractivo que hay que crear es ofrecer servicios adicionales, cuales?, esa es la pregunta.
Aclaro, en este blog solo aparecerán comentarios/resúmenes sobre las charlas que no aparecen en el número especial de Bioinformatics. Así que, hasta mañana.
La charla magistral de la mañana estuvo a cargo del famoso Michael Waterman, el mismo del algoritmo Smith-Waterman para el alineamiento de secuencias, por si acaso. El recibía el premio a "Senior scientist accomplishment".
Su charla estaba titulada "Whole Genome Optical Mapping", pero como afortunadamente siempre pasa con estos grandes hombres, nombres. La primera parte consistió en un poco de su historia en el área de biología computacional. Excelente y divertida. Referencias a su encuentro con Stan Ulam (Método de Monte Carlo) y luego con Temple Smith, con quién publicaría el artículo de alineamiento de secuencias. Y mas tarde con David Lipman )ahora director del NCBI, quién recibio este mismo premio en ISMB2004). Un par de referencias a artículos rechazados, artículos que luego serían el fundamento de mucho de lo que es hoy bioinformática. Una de las razones por las cuales los artículos fueron rechazados es que no existía un nicho para ese tipo de publicaciones. Y los artículos no eran ni de biología ni de matemáticas. Una referencia común poara todos aquellos que han iniciado un nuevo campo de investigación.
Luego de ese corto recuento histórico, habló sobre "whole genome optical mapping".
Luego vino la charla de Amos Bairoch (Swiss Prot), como parte del panel "Nuevas Fronteras", que trataba sobre financiación en bioinformática. El problema que plantea es la falta de financiación a largo plazo para manterner centros de datos. Su propuesta, que ambisiosamente quiere llamar "La declaración de Fortaleza", es crear una especie de impuesto para cada proyecto que genere grandes cantidades de datos que se tienen que mantener disponibles, accesibles y seguros a largo plazo. Este impuesto sería una parte del dinero otorgado para la financiación del proyecto.
Estas son algunas de las repsuestas del auditoria a la propuesta:
- No todos los proyectos deben pagar lo mismo. Pequeños proyectos deben pagar muy poco o nada, mientras que grandesconsorcios pagarían mas.
- En nuestra comunidad estamos acostrumbrados a compartir libre y públicamente los datos, pero no ocurre lo mismo en otros círculos. Así que se necesita educación en esa tema.
- Es importante ofrecer servicios adicionales, que haya mayores incentivos para que grandes proyectos destinen parte de su financiación al manejo y mantenimiento de datos.
Esa es la propuesta de Amos, obviamente mucho camino que recorrer. Y veo difícil "sacarle" una "tajada" a los proyectos de investigación "solo" para mantener los datos disponibles, como se sugirió en la discusión parte del atractivo que hay que crear es ofrecer servicios adicionales, cuales?, esa es la pregunta.
Aclaro, en este blog solo aparecerán comentarios/resúmenes sobre las charlas que no aparecen en el número especial de Bioinformatics. Así que, hasta mañana.
Etiquetas:
bioinformática,
brasil,
capoeira,
conferencias,
ISMB,
video
ISMB2006, Agosto 7: Conferencias
Hoy comenzó oficialmente el evento, y nada mejor que un poco de folclor brasilero para motivarnos.
Ahora si sobre algunas charlas. Hubo una demostración de software del EBI, presentando EBIMed, otra herramienta (ver entrada de ayer) para la explotación de textos en MEDLINE.
Luego tuvimos un par de charlas, parte del panel coordinado por Goran Neshich de Embrapa, sobre "Nuevas fronteras en Bioinformática y Biología Computacional". Que retos enfrentaremos en los próximos 10 años.
La primera charla estuvo a cargo de Janet Thornton, e insistía en que los nuevos retos de la bioinformática yacen en la transferencia de información y tecnologías hacia los campos de medicina y agricultura. Parte del reto está en el manejo de nuevos tipos de datos, como radiografias, pruebas clínicas, etc. Otra parte del reto es cumplir a las farmaceúticas en el desarrollo de nuevas drogas, mucho se especulo sobre esto con la secuenciación de genomas, pero hasta ahora poco ha resultado.
En resumén, según Janet, necesitamos:
-Aumento en educación en bioinformática.
-Modelos predictivos.
-Infraestructura bioinformática para la investigación clinica.
-Entender las bases moleculares de las enfermedades.
Y uno de los principales problemas a los que nos veremos enfrentados es que gran parte d elos datos son privados/protegidos, o por patentes o debido a la relación de confidencialidad paciente/doctor.
La segunda charla, ofrecida por Chris Sander. Una excelente y provocativa charla. Aquí están los siete puntos que según Chris constituyen los retos a los que nos veremos enfrentados en los próximos 10 años:
Esas fueron las sesiones mas provocativas del día.
Ahora si sobre algunas charlas. Hubo una demostración de software del EBI, presentando EBIMed, otra herramienta (ver entrada de ayer) para la explotación de textos en MEDLINE.
Luego tuvimos un par de charlas, parte del panel coordinado por Goran Neshich de Embrapa, sobre "Nuevas fronteras en Bioinformática y Biología Computacional". Que retos enfrentaremos en los próximos 10 años.
La primera charla estuvo a cargo de Janet Thornton, e insistía en que los nuevos retos de la bioinformática yacen en la transferencia de información y tecnologías hacia los campos de medicina y agricultura. Parte del reto está en el manejo de nuevos tipos de datos, como radiografias, pruebas clínicas, etc. Otra parte del reto es cumplir a las farmaceúticas en el desarrollo de nuevas drogas, mucho se especulo sobre esto con la secuenciación de genomas, pero hasta ahora poco ha resultado.
En resumén, según Janet, necesitamos:
-Aumento en educación en bioinformática.
-Modelos predictivos.
-Infraestructura bioinformática para la investigación clinica.
-Entender las bases moleculares de las enfermedades.
Y uno de los principales problemas a los que nos veremos enfrentados es que gran parte d elos datos son privados/protegidos, o por patentes o debido a la relación de confidencialidad paciente/doctor.
La segunda charla, ofrecida por Chris Sander. Una excelente y provocativa charla. Aquí están los siete puntos que según Chris constituyen los retos a los que nos veremos enfrentados en los próximos 10 años:
- Making biological function computable.
- Better quantitative models of evolution.
- Models of cellular decision process.
- Synthetic biology, nanotech and systems design.
- Neurobiology: From molecules to thinking.
- Genetic and somatic variations in humans.
- Close the gap between experiments and computation.
- Inform the public.
Esas fueron las sesiones mas provocativas del día.
Etiquetas:
bioinformática,
brasil,
conferencias,
forro,
ISMB,
video
domingo, agosto 06, 2006
ISMB2006, Agosto 6: Tutoriales
Hoy comenzó para mí la conferencia.
Asistí a dos tutoriales uno en la mañana (Biological literature mining: from information retrieval to biological discovery) y otro en la tarde (Bayesian networks for bioinformatics: an introduction to inference and learning).
El primero trataba sobre como usar la literatura existente (principalmente resúmenes de artículos en MEDLINE, con opción de textos completos disponibles en PUBMED Central) para hacer descubrimientos/hipótesis de carácter biólogico. Entre los problemas/retos mencionados, está el de identificar las entidades interesantes, nombres de gene/proteínas por ejemplo. Parte del problema radica en que algunas veces esas entidades reciben nombres no muy inteligentes, desde el punto de vista de la explotación de textos, como la proteína THE, o SDS. La primera un artículo muy común en inglés y la segunda un reactivo común en la preparación de geles. Otro problema mencionado radica en la ambiguedad de algunos términos. Ciertas entidades pueden usarse con diferentes significados. Al parecer la única solución a este problema en el momento es la participación de un experto humano. A pesar de los problemas que se mencionaron, está área es muy prometedora, la razón más clara, que fue mencionada en el turtorial, es que la cantidad de literatura disponible es tan grande que nadie es capaz de leerla toda, ni siquiera en un campo especializado, y por lo tanto conexiones entre hechos aislados pueden pasar desapercibidas. Las técnicas de explotación de textos (literature mining) pueden solucionar esto en gran medida, solo es cuestión de que se empiecen a usar mas. Una de las herramientas para el usuario final que más me intereso fue iHOP.
El segundo tutorial al que asistí trataba sobre redes bayesianas: cómo inferir sus parametros, la estructura y las relaciones causales (dirección de las aristas) a partir de datos. El principal problema es la inferencia de las relaciones causales, para lo cual se necesitan experimentos "bien pensados" en el laboratorio. Lo que de alguna forma le resta eficiencia (high-throughput).
Por hoy eso fue todo. Mañana tenemos las conferencias.
Asistí a dos tutoriales uno en la mañana (Biological literature mining: from information retrieval to biological discovery) y otro en la tarde (Bayesian networks for bioinformatics: an introduction to inference and learning).
El primero trataba sobre como usar la literatura existente (principalmente resúmenes de artículos en MEDLINE, con opción de textos completos disponibles en PUBMED Central) para hacer descubrimientos/hipótesis de carácter biólogico. Entre los problemas/retos mencionados, está el de identificar las entidades interesantes, nombres de gene/proteínas por ejemplo. Parte del problema radica en que algunas veces esas entidades reciben nombres no muy inteligentes, desde el punto de vista de la explotación de textos, como la proteína THE, o SDS. La primera un artículo muy común en inglés y la segunda un reactivo común en la preparación de geles. Otro problema mencionado radica en la ambiguedad de algunos términos. Ciertas entidades pueden usarse con diferentes significados. Al parecer la única solución a este problema en el momento es la participación de un experto humano. A pesar de los problemas que se mencionaron, está área es muy prometedora, la razón más clara, que fue mencionada en el turtorial, es que la cantidad de literatura disponible es tan grande que nadie es capaz de leerla toda, ni siquiera en un campo especializado, y por lo tanto conexiones entre hechos aislados pueden pasar desapercibidas. Las técnicas de explotación de textos (literature mining) pueden solucionar esto en gran medida, solo es cuestión de que se empiecen a usar mas. Una de las herramientas para el usuario final que más me intereso fue iHOP.
El segundo tutorial al que asistí trataba sobre redes bayesianas: cómo inferir sus parametros, la estructura y las relaciones causales (dirección de las aristas) a partir de datos. El principal problema es la inferencia de las relaciones causales, para lo cual se necesitan experimentos "bien pensados" en el laboratorio. Lo que de alguna forma le resta eficiencia (high-throughput).
Por hoy eso fue todo. Mañana tenemos las conferencias.
Etiquetas:
bayes,
bioinformática,
conferencias,
data mining,
ISMB
miércoles, agosto 02, 2006
ISMB2006 en Fortaleza, Brasil
El próximo fin de semana comienza ISMB, una de las reuniones mas grandes de bioinformática que hay. Allí presentaré un póster sobre mi trabajo con factores de transcripción en plantas. el objetivo es hacer la presentación en sociedad de las bases de datos que creé (copia del póster).
Espero publicar la próxima semana algunas entradas sobre la conferencia, ya veremos.
Espero publicar la próxima semana algunas entradas sobre la conferencia, ya veremos.
Etiquetas:
bioinformática,
brasil,
conferencias,
ISMB
domingo, abril 02, 2006
Mas sobre leyes de poder y distribuciones de conectividad en redes
La próxima semana inicia el ¨Workshop Molecular Interactions¨aquí en Berlin. Y decidí presentar un afiche (Are biological networks scale-free graphs?), que ilustre la forma en que se deben analizar algunos aspectos de redes complejas. La idea del afiche es promocionar este artículo escrito por Li y colaboradores.
En resumén muestra que el simple análisis ¨a ojo¨ de la distribución de conectividad en una red no es ni suficiente ni riguroso para decir que la red es scale-free. La opción recomendada es hacer una selección estadística de la distribución de probabilidad que mejor describe la distribución de conectividad, usando el criterio de información de Akaike (AIC). El segundo punto tratado, es evaluar la importancia de los hubs en la red. en una red scale-free los hubs son muy importantes, de forma que al removerlos la red se desconecta. La importancia de estos hubs se puede evaluar de dos formas, mediante el coeficiente de betweenness centrality o la métrica S definida en Li y cols.
En resumén muestra que el simple análisis ¨a ojo¨ de la distribución de conectividad en una red no es ni suficiente ni riguroso para decir que la red es scale-free. La opción recomendada es hacer una selección estadística de la distribución de probabilidad que mejor describe la distribución de conectividad, usando el criterio de información de Akaike (AIC). El segundo punto tratado, es evaluar la importancia de los hubs en la red. en una red scale-free los hubs son muy importantes, de forma que al removerlos la red se desconecta. La importancia de estos hubs se puede evaluar de dos formas, mediante el coeficiente de betweenness centrality o la métrica S definida en Li y cols.
Suscribirse a:
Entradas (Atom)