De vez en cuando, en el marco de diferentes análisis es importante hacer referencia a diferentes propiedades numéricas de los organismos, como número de chromosomas, tamaño del genoma, número de tipos celulares, etc. Y siempre toma bastante tiempo encontrar las referencias primarias. Afortunadamente un equipo del departamento de biología de sistema en harvard, decidio crear una base de datos, Bionumbers, en la cual almacenar y hacer públicos esos datos, con referencias a los reportes originales.
Además, cualquiera, luego de registrarse, puede agregar nuevos números biológicos, siguiendo la misma filosofía de la wikipedia.
Así que, a agregar mas bio-números.
domingo, junio 01, 2008
martes, mayo 13, 2008
Albert Einstein on Religions from a letter to Jewish philosopher Eric Gutkind
Palabras de Don Albert Einstein sobre sus creencias religiosas:"The word god is for me nothing more than the expression and product of human weaknesses, the Bible a collection of honourable, but still primitive legends which are nevertheless pretty childish. No interpretation no matter how subtle can (for me) change this."
Mayor información: The Guardian and The Guardian
sábado, mayo 10, 2008
Factores de transcripción bZIPs en plantas - Nube de etiquetas
Tenemos que un artículo sobre la familia de factores de transcripción bZIP, que acabamos de enviar a PLoS ONE, en segunda vuelta. (actualización: artículo publicado el 12.08.08)
Aquí está la nube de etiquetas para que se haganuna idea de que trata el artículo.
Aquí está la nube de etiquetas para que se haganuna idea de que trata el artículo.
Etiquetas:
algas,
ancestrales,
bZIPs,
evolución,
factores de transcripción,
funciones,
plantas,
verdes
Factores de transcripción en Chlamydomonas
Siguiendo el ejemplo de Clastic Detritus y Green Gabbro, aquí va la nube de etiquetas (creada con TagCrowd) de uno de mis artículos recientes, que fue publicado en Genetics (Vol 179 No. 1, pp 31-39). Chlamydomonas es un alga verde, y el artículo trata de las familias de factores de transcripción es esta alga y otras plantas.
Etiquetas:
algas,
bioinformática,
evolución,
factores de transcripción,
funciones,
networks,
plantas,
regulación,
verdes
martes, marzo 25, 2008
Las cinco emociones de estar escribiendo la tesis
Corto y al punto:
Desesperanza, frustración, irritabilidad, alivio, robot.
Buena entrada en Green Gabbro
Desesperanza, frustración, irritabilidad, alivio, robot.
Buena entrada en Green Gabbro
Etiquetas:
blog,
doctorado,
escribir,
green gabbro,
tesis
lunes, junio 04, 2007
Dinucleotide shuffle
Una de las estrategias comúnmente empleadas en el estudio de ARN no codificantes, es estimar la "energía mínima de plegamiento (MFE por sus siglas en inglés)" de la estructura secundaria del ARN candidato. Este enfoque se basa en el hecho de que en muchos ARN no codificantes la estructura secundaria de la molécula es importante para su desempeño en el sistema biológico.
Usualmente la MFE estimada se compara con la MFE de secuencias al azar derivadas por re-ordenamiento de la secuencia original de ARN ("nucleotide suffling"). La hipótesis subyacente es que ARN no codificantes funcionales tendrán una estructura secundaria más estable (con menor MFE) que la predicha para una secuencia al azar de la misma composición nucleótidica.
La hipótesis funcionaría bien si los programas de predicción de estructuras secundarias fuesen completamente independientes de los sesgos en el contenido se bases nucléotidicas en las secuencias. Desafortunadamente esto no ocurre. La predicción de estructuras secundarias se basa en observaciones experimentales de la energía libre de di-nucleótidos apilados, de forma que la composición de di-nucleótidos en la secuencia es un factor que tiene que ser controlado en el experimento computacional.
La forma de controlar por el efecto de la composición de di-nucleótidos es generando secuencias al azar en donde esta composición sea idéntica (de forma exacta o estadísticamente) a la de la secuencia original. De forma que si la MFE es realemente significativa, y no solo efecto del sesgo di-nucleótidico, esta será (estadísticamente) menor que la de la secuencia al azar.
La generación de secuencias al azar que conservan la composición de di-nucleótidos es un poco mas complicada que aquella en donde solo la composición de monómeros es preservada. En 1985 Altschul y Erickson desarrollaron un algoritmo para generar este tipo de secuencias aleatorias, del cual hay varias implementaciones. Una de ellas, en perl, esta disponible en MacResearch.
Así que no olvidar generar secuencias al azar que conserven la composición de di-nucleótidos cuando se analice la estabilidad de estructuras secundarias de ARN.
Usualmente la MFE estimada se compara con la MFE de secuencias al azar derivadas por re-ordenamiento de la secuencia original de ARN ("nucleotide suffling"). La hipótesis subyacente es que ARN no codificantes funcionales tendrán una estructura secundaria más estable (con menor MFE) que la predicha para una secuencia al azar de la misma composición nucleótidica.
La hipótesis funcionaría bien si los programas de predicción de estructuras secundarias fuesen completamente independientes de los sesgos en el contenido se bases nucléotidicas en las secuencias. Desafortunadamente esto no ocurre. La predicción de estructuras secundarias se basa en observaciones experimentales de la energía libre de di-nucleótidos apilados, de forma que la composición de di-nucleótidos en la secuencia es un factor que tiene que ser controlado en el experimento computacional.
La forma de controlar por el efecto de la composición de di-nucleótidos es generando secuencias al azar en donde esta composición sea idéntica (de forma exacta o estadísticamente) a la de la secuencia original. De forma que si la MFE es realemente significativa, y no solo efecto del sesgo di-nucleótidico, esta será (estadísticamente) menor que la de la secuencia al azar.
La generación de secuencias al azar que conservan la composición de di-nucleótidos es un poco mas complicada que aquella en donde solo la composición de monómeros es preservada. En 1985 Altschul y Erickson desarrollaron un algoritmo para generar este tipo de secuencias aleatorias, del cual hay varias implementaciones. Una de ellas, en perl, esta disponible en MacResearch.
Así que no olvidar generar secuencias al azar que conserven la composición de di-nucleótidos cuando se analice la estabilidad de estructuras secundarias de ARN.
Etiquetas:
bioinformática,
dinucleotide,
estructura secundaria,
programación,
rna,
shuffle
miércoles, marzo 21, 2007
OpenKapow
Conocí openkapow por un artículo en el blog de Pedro Beltrao, e inmediatamente decidí ensayarlo y ver que posibilidades brindaba.
Básicamente, openkapow sirve para reunir datos de diferentes sitios web en forma sistemática.
Yo tenía el siguiente poblema: necesitaba obtener la ubicacíon en el borrador del genoma de Chlamydomonas reinhardtii para cada uno de los factores de transcripción que aparecen en ChlamyTFDB.
La información sobre la ubicación en el genoma está en páginas web del JGI/DOE, y cada uno de los factores de transcripción en ChlamyTFDB tiene un hipervínculo a la página del JGI/DOE apropiada.
Claro, esta tarea se puede resolver usando, por ejemplo, scripts de PERL, pero eso significa una inversión significativa de tiempo, planenado, escribiendo y corrigiendo el script. Y aquí es donde openkapow nos ayuda.
Mediante una interface gráfica, Openkapow, permite construir paso a paso las acciones requeridas para navegar diferentes páginas, extraer datos usando el puntero del ratón y cliqueando, y exportar los datos a la web o archivos de texto locales en formato CSV, XML o HTML.
Creo que el único requisito para usar OpenKapow es poder estructurar el problema en forma programática, luego es aplicar la estructura en la interace de OpenKapow, incluso añadiendo control de errores, entrada de datos, y filtrado de resultados basado en expresiones regulares, si se desea.
En realidad me parece una excelente herramienta y se las recomiendo.
Básicamente, openkapow sirve para reunir datos de diferentes sitios web en forma sistemática.
Yo tenía el siguiente poblema: necesitaba obtener la ubicacíon en el borrador del genoma de Chlamydomonas reinhardtii para cada uno de los factores de transcripción que aparecen en ChlamyTFDB.
La información sobre la ubicación en el genoma está en páginas web del JGI/DOE, y cada uno de los factores de transcripción en ChlamyTFDB tiene un hipervínculo a la página del JGI/DOE apropiada.
Claro, esta tarea se puede resolver usando, por ejemplo, scripts de PERL, pero eso significa una inversión significativa de tiempo, planenado, escribiendo y corrigiendo el script. Y aquí es donde openkapow nos ayuda.
Mediante una interface gráfica, Openkapow, permite construir paso a paso las acciones requeridas para navegar diferentes páginas, extraer datos usando el puntero del ratón y cliqueando, y exportar los datos a la web o archivos de texto locales en formato CSV, XML o HTML.
Creo que el único requisito para usar OpenKapow es poder estructurar el problema en forma programática, luego es aplicar la estructura en la interace de OpenKapow, incluso añadiendo control de errores, entrada de datos, y filtrado de resultados basado en expresiones regulares, si se desea.
En realidad me parece una excelente herramienta y se las recomiendo.
jueves, febrero 08, 2007
Propaganda PlnTFDB
Después de 4 meses de estar incapacitado, por un problema con mi pierna derecha, vuelvo a la universidad. Claro, esos 4 meses no fueron perdida completa. Salió un artículo presentando la base de datos de factores de transcripción en plantas (PlnTFDB: Plant Transcription Factor Database) que hemos creado.
Decidimos publicar el artíclo en BMC Bioinformatics, una revista de acceso abierto (Open Access, OA). Sobre el modelo de OA, solo ventajas. Primero, el artículo está disponible en internet para todo aquel que este interesado en leerlo, es posible redistribuirlo libremente, y crear trabajos derivados siempre y cuando la fuente original se referencie apropiadamente. En segundo lugar, el tiempo total desde que se envió el artículo por primera vez a la revista hasta que fue publicado en línea, fue de 47 días. Los comentarios y sugerencias de los evaluadores anónimos fueron en verdad de ayuda para mejorar la calidad del artículo y presentar un mensaje mas claro, y en algunos casos mejorar la base de datos en línea.
Lo que viene ahora es extender la base de datos, principalmente agregar datos experimentales sobre los factores de transcripción que hemos predicho.
Decidimos publicar el artíclo en BMC Bioinformatics, una revista de acceso abierto (Open Access, OA). Sobre el modelo de OA, solo ventajas. Primero, el artículo está disponible en internet para todo aquel que este interesado en leerlo, es posible redistribuirlo libremente, y crear trabajos derivados siempre y cuando la fuente original se referencie apropiadamente. En segundo lugar, el tiempo total desde que se envió el artículo por primera vez a la revista hasta que fue publicado en línea, fue de 47 días. Los comentarios y sugerencias de los evaluadores anónimos fueron en verdad de ayuda para mejorar la calidad del artículo y presentar un mensaje mas claro, y en algunos casos mejorar la base de datos en línea.
Lo que viene ahora es extender la base de datos, principalmente agregar datos experimentales sobre los factores de transcripción que hemos predicho.
Etiquetas:
factores de transcripción,
plntfdb
miércoles, noviembre 29, 2006
First Online EMBL PhD Symposium
Del 4 al 8 de Diciembre se llevará a cabo el primer simposio en línea del EMBL. Completamente gratis y los interesador en proveer contenido, ofrecer charlas, presentar "posters" son libres de hacerlo previo registro. Yo me enteré via el blog the Pedro Beltrao.
Hay tres ejes principales de presentaciones y discusión:
Sin lugar a dudas es un experimento interesante, realizar el encuentro en línea y completamente gratuito. Posiblemente sirva como un mecanismo adicional de popularización de la ciencia y de los retos y preguntas que siempre tenemos que abordar, así no sean propiamente científicos.
bueno, entocnes por "allá" nos vemos.
Hay tres ejes principales de presentaciones y discusión:
- Desarrollo de carreras en ciencias
- Biología de sistemas / ómicas
- Comunicación en ciencias 2.0
Sin lugar a dudas es un experimento interesante, realizar el encuentro en línea y completamente gratuito. Posiblemente sirva como un mecanismo adicional de popularización de la ciencia y de los retos y preguntas que siempre tenemos que abordar, así no sean propiamente científicos.
bueno, entocnes por "allá" nos vemos.
Etiquetas:
bioinformática,
EMBL,
encuentro
jueves, agosto 10, 2006
ISMB2006, Agosto 10: Conferencias
Último día en ISMB.
Empezamos el día con la magnífica conferencia magistral de Richard Roberts.
Inició su charla con una transparencia apoyando el acceso libre a la literatura científica (Open Access). Nos contó que ya no hace evaluaciones para revistas científicas que no hagan parte de este movimiento, ni tampoco hace parte de sus comités editoriales. Y sugirió obrar de similar manera.
El objetivo es que toda la literatura este públicamente disponible en línea, de esa forma podremos empezar a explotar todos esos datos y hacer, tal vez, descubrimientos biológicos. Muchos descubrimientos se han hecho tarde por falta de acceso a la literatura relevante. Esa es la primcipal motivación del movimiento.
A continuación, exhortó a la comunidad bioinformática a realizar verificaciones de sus predicciones computacionales. Parafraseándolo: "Nadie va a probar las predicciones hechas por alguién mas". Así que a colaborar mas con experimentalistas.
El siguiente punto que tocó fue su falta de confianza en la biología de sistemas. su razón: No estamos en un momento en que podamos realizar biología al nivel de sistemas en la forma enque está propuesta por que necesitamos todavía mucha mas información básica, bioquímica. Es cierto que tenemos a disposición largos listados de componentes celulares, pero hace falta conocer la(s) función(es) de la mayoría de estos componentes.
Junto a esto, menciona que es prácticamente criminal la cantidad de dinero que se viene invirtiendo en los proyectos de secuenciación, sin una inversión concomitante en proyectos de anotación.
La siguiente parte de su charla trató sobre su trabajo científico en New England Biolabs. Está compañia vende enzimas de restricción, así que sobre estas habló.
El punto mas interesante, que es el que consignaré aquí, fue sobre como de los datos de secuenciación de genomas (Whole genome shotgun sequencing, WGSS en adelante) todavía se pueden extraer ciertos hechos interesantes y biológicamente relevantes.
Las enzimas de restricción (ER, en adelante) se encuentran en bacteria y archaea, y cumplen la tarea de destruir ADN exógeno, reconociendo y cortando en secuencias cortas copn alta especificidad. Para evitar que las ER destruyan el ADN local, estos organismos tienen enzimas de modificación (EM), que generalmente metilan al ADN en las mismas secuencias de reconocimiento de las ER. En la mayoría de los casos ER y EM están codificadas de forma contigua en el genoma.
Que tiene que ver eso con WGSS?
Primero recordemos brevemente que es el WGSS. El genoma completo de un organismo se hace pedazos de forma aleatoria, y cada fragmento es clonado en una bacteria, usualmente Escherichia coli. Luego cada fragmento es secuenciado y en un último paso las secuencias de cada fragmentos se ensamblam para reconstruir el genoma inicial.
Ahora si, que tienen que ver ER y WGSS. Si uno de estos fragmentos generados al azar contiene la secuencia completa de una ER que no se encuentra nativamente en el organismo en el que se clona e.g. E. coli, es posible que esta enzima sea transcrita y traducida, y empiece a degradar el genoma, lo que terminará matando a la bacteria, por lo que será imposible recuperar clones que incluyan esos fragmentos. Por lo tanto habrá "gaps" en el mapa de clones del genoma. Esto fue lo que el grupo de Roberts buscó en los datos originales de secuenciación de Haemophilus influenzae, que eran mantenidos en el sotáno de TIGR en cinta magnética.
Ellos encontraron que había gaps en el mapa de clones, y que el gap era seguido por la secuencia de una enzima de modificación, tal y cual había sido predicho. Esto permitió descubrir nuevas ER, cuya función y actividad fue confirmada experimentalmente.
Bueno, esta fue la resumida bitácora de ISMB2006.
Empezamos el día con la magnífica conferencia magistral de Richard Roberts.
Inició su charla con una transparencia apoyando el acceso libre a la literatura científica (Open Access). Nos contó que ya no hace evaluaciones para revistas científicas que no hagan parte de este movimiento, ni tampoco hace parte de sus comités editoriales. Y sugirió obrar de similar manera.
El objetivo es que toda la literatura este públicamente disponible en línea, de esa forma podremos empezar a explotar todos esos datos y hacer, tal vez, descubrimientos biológicos. Muchos descubrimientos se han hecho tarde por falta de acceso a la literatura relevante. Esa es la primcipal motivación del movimiento.
A continuación, exhortó a la comunidad bioinformática a realizar verificaciones de sus predicciones computacionales. Parafraseándolo: "Nadie va a probar las predicciones hechas por alguién mas". Así que a colaborar mas con experimentalistas.
El siguiente punto que tocó fue su falta de confianza en la biología de sistemas. su razón: No estamos en un momento en que podamos realizar biología al nivel de sistemas en la forma enque está propuesta por que necesitamos todavía mucha mas información básica, bioquímica. Es cierto que tenemos a disposición largos listados de componentes celulares, pero hace falta conocer la(s) función(es) de la mayoría de estos componentes.
Junto a esto, menciona que es prácticamente criminal la cantidad de dinero que se viene invirtiendo en los proyectos de secuenciación, sin una inversión concomitante en proyectos de anotación.
La siguiente parte de su charla trató sobre su trabajo científico en New England Biolabs. Está compañia vende enzimas de restricción, así que sobre estas habló.
El punto mas interesante, que es el que consignaré aquí, fue sobre como de los datos de secuenciación de genomas (Whole genome shotgun sequencing, WGSS en adelante) todavía se pueden extraer ciertos hechos interesantes y biológicamente relevantes.
Las enzimas de restricción (ER, en adelante) se encuentran en bacteria y archaea, y cumplen la tarea de destruir ADN exógeno, reconociendo y cortando en secuencias cortas copn alta especificidad. Para evitar que las ER destruyan el ADN local, estos organismos tienen enzimas de modificación (EM), que generalmente metilan al ADN en las mismas secuencias de reconocimiento de las ER. En la mayoría de los casos ER y EM están codificadas de forma contigua en el genoma.
Que tiene que ver eso con WGSS?
Primero recordemos brevemente que es el WGSS. El genoma completo de un organismo se hace pedazos de forma aleatoria, y cada fragmento es clonado en una bacteria, usualmente Escherichia coli. Luego cada fragmento es secuenciado y en un último paso las secuencias de cada fragmentos se ensamblam para reconstruir el genoma inicial.
Ahora si, que tienen que ver ER y WGSS. Si uno de estos fragmentos generados al azar contiene la secuencia completa de una ER que no se encuentra nativamente en el organismo en el que se clona e.g. E. coli, es posible que esta enzima sea transcrita y traducida, y empiece a degradar el genoma, lo que terminará matando a la bacteria, por lo que será imposible recuperar clones que incluyan esos fragmentos. Por lo tanto habrá "gaps" en el mapa de clones del genoma. Esto fue lo que el grupo de Roberts buscó en los datos originales de secuenciación de Haemophilus influenzae, que eran mantenidos en el sotáno de TIGR en cinta magnética.
Ellos encontraron que había gaps en el mapa de clones, y que el gap era seguido por la secuencia de una enzima de modificación, tal y cual había sido predicho. Esto permitió descubrir nuevas ER, cuya función y actividad fue confirmada experimentalmente.
Bueno, esta fue la resumida bitácora de ISMB2006.
Etiquetas:
bioinformática,
conferencias,
ISMB,
open access
martes, agosto 08, 2006
ISMB2006, Agosto 8: Conferencias
En un nuevo día, capoeira:
La charla magistral de la mañana estuvo a cargo del famoso Michael Waterman, el mismo del algoritmo Smith-Waterman para el alineamiento de secuencias, por si acaso. El recibía el premio a "Senior scientist accomplishment".
Su charla estaba titulada "Whole Genome Optical Mapping", pero como afortunadamente siempre pasa con estos grandes hombres, nombres. La primera parte consistió en un poco de su historia en el área de biología computacional. Excelente y divertida. Referencias a su encuentro con Stan Ulam (Método de Monte Carlo) y luego con Temple Smith, con quién publicaría el artículo de alineamiento de secuencias. Y mas tarde con David Lipman )ahora director del NCBI, quién recibio este mismo premio en ISMB2004). Un par de referencias a artículos rechazados, artículos que luego serían el fundamento de mucho de lo que es hoy bioinformática. Una de las razones por las cuales los artículos fueron rechazados es que no existía un nicho para ese tipo de publicaciones. Y los artículos no eran ni de biología ni de matemáticas. Una referencia común poara todos aquellos que han iniciado un nuevo campo de investigación.
Luego de ese corto recuento histórico, habló sobre "whole genome optical mapping".
Luego vino la charla de Amos Bairoch (Swiss Prot), como parte del panel "Nuevas Fronteras", que trataba sobre financiación en bioinformática. El problema que plantea es la falta de financiación a largo plazo para manterner centros de datos. Su propuesta, que ambisiosamente quiere llamar "La declaración de Fortaleza", es crear una especie de impuesto para cada proyecto que genere grandes cantidades de datos que se tienen que mantener disponibles, accesibles y seguros a largo plazo. Este impuesto sería una parte del dinero otorgado para la financiación del proyecto.
Estas son algunas de las repsuestas del auditoria a la propuesta:
Esa es la propuesta de Amos, obviamente mucho camino que recorrer. Y veo difícil "sacarle" una "tajada" a los proyectos de investigación "solo" para mantener los datos disponibles, como se sugirió en la discusión parte del atractivo que hay que crear es ofrecer servicios adicionales, cuales?, esa es la pregunta.
Aclaro, en este blog solo aparecerán comentarios/resúmenes sobre las charlas que no aparecen en el número especial de Bioinformatics. Así que, hasta mañana.
La charla magistral de la mañana estuvo a cargo del famoso Michael Waterman, el mismo del algoritmo Smith-Waterman para el alineamiento de secuencias, por si acaso. El recibía el premio a "Senior scientist accomplishment".
Su charla estaba titulada "Whole Genome Optical Mapping", pero como afortunadamente siempre pasa con estos grandes hombres, nombres. La primera parte consistió en un poco de su historia en el área de biología computacional. Excelente y divertida. Referencias a su encuentro con Stan Ulam (Método de Monte Carlo) y luego con Temple Smith, con quién publicaría el artículo de alineamiento de secuencias. Y mas tarde con David Lipman )ahora director del NCBI, quién recibio este mismo premio en ISMB2004). Un par de referencias a artículos rechazados, artículos que luego serían el fundamento de mucho de lo que es hoy bioinformática. Una de las razones por las cuales los artículos fueron rechazados es que no existía un nicho para ese tipo de publicaciones. Y los artículos no eran ni de biología ni de matemáticas. Una referencia común poara todos aquellos que han iniciado un nuevo campo de investigación.
Luego de ese corto recuento histórico, habló sobre "whole genome optical mapping".
Luego vino la charla de Amos Bairoch (Swiss Prot), como parte del panel "Nuevas Fronteras", que trataba sobre financiación en bioinformática. El problema que plantea es la falta de financiación a largo plazo para manterner centros de datos. Su propuesta, que ambisiosamente quiere llamar "La declaración de Fortaleza", es crear una especie de impuesto para cada proyecto que genere grandes cantidades de datos que se tienen que mantener disponibles, accesibles y seguros a largo plazo. Este impuesto sería una parte del dinero otorgado para la financiación del proyecto.
Estas son algunas de las repsuestas del auditoria a la propuesta:
- No todos los proyectos deben pagar lo mismo. Pequeños proyectos deben pagar muy poco o nada, mientras que grandesconsorcios pagarían mas.
- En nuestra comunidad estamos acostrumbrados a compartir libre y públicamente los datos, pero no ocurre lo mismo en otros círculos. Así que se necesita educación en esa tema.
- Es importante ofrecer servicios adicionales, que haya mayores incentivos para que grandes proyectos destinen parte de su financiación al manejo y mantenimiento de datos.
Esa es la propuesta de Amos, obviamente mucho camino que recorrer. Y veo difícil "sacarle" una "tajada" a los proyectos de investigación "solo" para mantener los datos disponibles, como se sugirió en la discusión parte del atractivo que hay que crear es ofrecer servicios adicionales, cuales?, esa es la pregunta.
Aclaro, en este blog solo aparecerán comentarios/resúmenes sobre las charlas que no aparecen en el número especial de Bioinformatics. Así que, hasta mañana.
Etiquetas:
bioinformática,
brasil,
capoeira,
conferencias,
ISMB,
video
ISMB2006, Agosto 7: Conferencias
Hoy comenzó oficialmente el evento, y nada mejor que un poco de folclor brasilero para motivarnos.
Ahora si sobre algunas charlas. Hubo una demostración de software del EBI, presentando EBIMed, otra herramienta (ver entrada de ayer) para la explotación de textos en MEDLINE.
Luego tuvimos un par de charlas, parte del panel coordinado por Goran Neshich de Embrapa, sobre "Nuevas fronteras en Bioinformática y Biología Computacional". Que retos enfrentaremos en los próximos 10 años.
La primera charla estuvo a cargo de Janet Thornton, e insistía en que los nuevos retos de la bioinformática yacen en la transferencia de información y tecnologías hacia los campos de medicina y agricultura. Parte del reto está en el manejo de nuevos tipos de datos, como radiografias, pruebas clínicas, etc. Otra parte del reto es cumplir a las farmaceúticas en el desarrollo de nuevas drogas, mucho se especulo sobre esto con la secuenciación de genomas, pero hasta ahora poco ha resultado.
En resumén, según Janet, necesitamos:
-Aumento en educación en bioinformática.
-Modelos predictivos.
-Infraestructura bioinformática para la investigación clinica.
-Entender las bases moleculares de las enfermedades.
Y uno de los principales problemas a los que nos veremos enfrentados es que gran parte d elos datos son privados/protegidos, o por patentes o debido a la relación de confidencialidad paciente/doctor.
La segunda charla, ofrecida por Chris Sander. Una excelente y provocativa charla. Aquí están los siete puntos que según Chris constituyen los retos a los que nos veremos enfrentados en los próximos 10 años:
Esas fueron las sesiones mas provocativas del día.
Ahora si sobre algunas charlas. Hubo una demostración de software del EBI, presentando EBIMed, otra herramienta (ver entrada de ayer) para la explotación de textos en MEDLINE.
Luego tuvimos un par de charlas, parte del panel coordinado por Goran Neshich de Embrapa, sobre "Nuevas fronteras en Bioinformática y Biología Computacional". Que retos enfrentaremos en los próximos 10 años.
La primera charla estuvo a cargo de Janet Thornton, e insistía en que los nuevos retos de la bioinformática yacen en la transferencia de información y tecnologías hacia los campos de medicina y agricultura. Parte del reto está en el manejo de nuevos tipos de datos, como radiografias, pruebas clínicas, etc. Otra parte del reto es cumplir a las farmaceúticas en el desarrollo de nuevas drogas, mucho se especulo sobre esto con la secuenciación de genomas, pero hasta ahora poco ha resultado.
En resumén, según Janet, necesitamos:
-Aumento en educación en bioinformática.
-Modelos predictivos.
-Infraestructura bioinformática para la investigación clinica.
-Entender las bases moleculares de las enfermedades.
Y uno de los principales problemas a los que nos veremos enfrentados es que gran parte d elos datos son privados/protegidos, o por patentes o debido a la relación de confidencialidad paciente/doctor.
La segunda charla, ofrecida por Chris Sander. Una excelente y provocativa charla. Aquí están los siete puntos que según Chris constituyen los retos a los que nos veremos enfrentados en los próximos 10 años:
- Making biological function computable.
- Better quantitative models of evolution.
- Models of cellular decision process.
- Synthetic biology, nanotech and systems design.
- Neurobiology: From molecules to thinking.
- Genetic and somatic variations in humans.
- Close the gap between experiments and computation.
- Inform the public.
Esas fueron las sesiones mas provocativas del día.
Etiquetas:
bioinformática,
brasil,
conferencias,
forro,
ISMB,
video
domingo, agosto 06, 2006
ISMB2006, Agosto 6: Tutoriales
Hoy comenzó para mí la conferencia.
Asistí a dos tutoriales uno en la mañana (Biological literature mining: from information retrieval to biological discovery) y otro en la tarde (Bayesian networks for bioinformatics: an introduction to inference and learning).
El primero trataba sobre como usar la literatura existente (principalmente resúmenes de artículos en MEDLINE, con opción de textos completos disponibles en PUBMED Central) para hacer descubrimientos/hipótesis de carácter biólogico. Entre los problemas/retos mencionados, está el de identificar las entidades interesantes, nombres de gene/proteínas por ejemplo. Parte del problema radica en que algunas veces esas entidades reciben nombres no muy inteligentes, desde el punto de vista de la explotación de textos, como la proteína THE, o SDS. La primera un artículo muy común en inglés y la segunda un reactivo común en la preparación de geles. Otro problema mencionado radica en la ambiguedad de algunos términos. Ciertas entidades pueden usarse con diferentes significados. Al parecer la única solución a este problema en el momento es la participación de un experto humano. A pesar de los problemas que se mencionaron, está área es muy prometedora, la razón más clara, que fue mencionada en el turtorial, es que la cantidad de literatura disponible es tan grande que nadie es capaz de leerla toda, ni siquiera en un campo especializado, y por lo tanto conexiones entre hechos aislados pueden pasar desapercibidas. Las técnicas de explotación de textos (literature mining) pueden solucionar esto en gran medida, solo es cuestión de que se empiecen a usar mas. Una de las herramientas para el usuario final que más me intereso fue iHOP.
El segundo tutorial al que asistí trataba sobre redes bayesianas: cómo inferir sus parametros, la estructura y las relaciones causales (dirección de las aristas) a partir de datos. El principal problema es la inferencia de las relaciones causales, para lo cual se necesitan experimentos "bien pensados" en el laboratorio. Lo que de alguna forma le resta eficiencia (high-throughput).
Por hoy eso fue todo. Mañana tenemos las conferencias.
Asistí a dos tutoriales uno en la mañana (Biological literature mining: from information retrieval to biological discovery) y otro en la tarde (Bayesian networks for bioinformatics: an introduction to inference and learning).
El primero trataba sobre como usar la literatura existente (principalmente resúmenes de artículos en MEDLINE, con opción de textos completos disponibles en PUBMED Central) para hacer descubrimientos/hipótesis de carácter biólogico. Entre los problemas/retos mencionados, está el de identificar las entidades interesantes, nombres de gene/proteínas por ejemplo. Parte del problema radica en que algunas veces esas entidades reciben nombres no muy inteligentes, desde el punto de vista de la explotación de textos, como la proteína THE, o SDS. La primera un artículo muy común en inglés y la segunda un reactivo común en la preparación de geles. Otro problema mencionado radica en la ambiguedad de algunos términos. Ciertas entidades pueden usarse con diferentes significados. Al parecer la única solución a este problema en el momento es la participación de un experto humano. A pesar de los problemas que se mencionaron, está área es muy prometedora, la razón más clara, que fue mencionada en el turtorial, es que la cantidad de literatura disponible es tan grande que nadie es capaz de leerla toda, ni siquiera en un campo especializado, y por lo tanto conexiones entre hechos aislados pueden pasar desapercibidas. Las técnicas de explotación de textos (literature mining) pueden solucionar esto en gran medida, solo es cuestión de que se empiecen a usar mas. Una de las herramientas para el usuario final que más me intereso fue iHOP.
El segundo tutorial al que asistí trataba sobre redes bayesianas: cómo inferir sus parametros, la estructura y las relaciones causales (dirección de las aristas) a partir de datos. El principal problema es la inferencia de las relaciones causales, para lo cual se necesitan experimentos "bien pensados" en el laboratorio. Lo que de alguna forma le resta eficiencia (high-throughput).
Por hoy eso fue todo. Mañana tenemos las conferencias.
Etiquetas:
bayes,
bioinformática,
conferencias,
data mining,
ISMB
miércoles, agosto 02, 2006
ISMB2006 en Fortaleza, Brasil
El próximo fin de semana comienza ISMB, una de las reuniones mas grandes de bioinformática que hay. Allí presentaré un póster sobre mi trabajo con factores de transcripción en plantas. el objetivo es hacer la presentación en sociedad de las bases de datos que creé (copia del póster).
Espero publicar la próxima semana algunas entradas sobre la conferencia, ya veremos.
Espero publicar la próxima semana algunas entradas sobre la conferencia, ya veremos.
Etiquetas:
bioinformática,
brasil,
conferencias,
ISMB
domingo, abril 02, 2006
Mas sobre leyes de poder y distribuciones de conectividad en redes
La próxima semana inicia el ¨Workshop Molecular Interactions¨aquí en Berlin. Y decidí presentar un afiche (Are biological networks scale-free graphs?), que ilustre la forma en que se deben analizar algunos aspectos de redes complejas. La idea del afiche es promocionar este artículo escrito por Li y colaboradores.
En resumén muestra que el simple análisis ¨a ojo¨ de la distribución de conectividad en una red no es ni suficiente ni riguroso para decir que la red es scale-free. La opción recomendada es hacer una selección estadística de la distribución de probabilidad que mejor describe la distribución de conectividad, usando el criterio de información de Akaike (AIC). El segundo punto tratado, es evaluar la importancia de los hubs en la red. en una red scale-free los hubs son muy importantes, de forma que al removerlos la red se desconecta. La importancia de estos hubs se puede evaluar de dos formas, mediante el coeficiente de betweenness centrality o la métrica S definida en Li y cols.
En resumén muestra que el simple análisis ¨a ojo¨ de la distribución de conectividad en una red no es ni suficiente ni riguroso para decir que la red es scale-free. La opción recomendada es hacer una selección estadística de la distribución de probabilidad que mejor describe la distribución de conectividad, usando el criterio de información de Akaike (AIC). El segundo punto tratado, es evaluar la importancia de los hubs en la red. en una red scale-free los hubs son muy importantes, de forma que al removerlos la red se desconecta. La importancia de estos hubs se puede evaluar de dos formas, mediante el coeficiente de betweenness centrality o la métrica S definida en Li y cols.
viernes, enero 20, 2006
Leyes de poder en redes? (power laws in networks?)
Recientemente ha sonado mucho este tema. El blog the P. Beltrao tiene una excelente discusión al respecto.
Este es un pequeñísimo resúmen:
En 1999 el grupo de Barabasi dió a conocer que la distribución de conexión (degree distribution) de las páginas en internet (links) podía ser descrita por una ley de poder.
A partir de ese momento, las distribuciones de conexiones de muchas redes complejas se empezaron a describir con leyes de poder. Las conexiones de redes de computadores, las interacciones entre proteínas, las redes de regulacién de la transcripción, etc. . . Fue contagioso, red a la que se le "ponáin las manos encima", red que se describia con una ley de poder.
Pero en el 2005 aparecieron serías criticas al respecto. No todas las redes complejas tienen una distribución de conexión que puede ser descrita por una ley de poder. Muchas de las que así habían sido descritas están siendo reexaminadas (algunos artículos sobre el tema).
El problema radica en que muchos estudios se apresuraron en buscar leyes de poder, sin contemplar otros modelos. Precisamente lo que se está encontrando ahora es que la distribución de conexiones en varias redes puede ser mejor descrita por otros modelos (ej. lognormal). De destacar el trabajo de Stumpf et al (1 y 2) y de Tanaka. En donde además de mostrar el "error" se proponen formas eficientes para evaluar modelos y examinar criticamente los resultados.
Este es un pequeñísimo resúmen:
En 1999 el grupo de Barabasi dió a conocer que la distribución de conexión (degree distribution) de las páginas en internet (links) podía ser descrita por una ley de poder.
A partir de ese momento, las distribuciones de conexiones de muchas redes complejas se empezaron a describir con leyes de poder. Las conexiones de redes de computadores, las interacciones entre proteínas, las redes de regulacién de la transcripción, etc. . . Fue contagioso, red a la que se le "ponáin las manos encima", red que se describia con una ley de poder.
Pero en el 2005 aparecieron serías criticas al respecto. No todas las redes complejas tienen una distribución de conexión que puede ser descrita por una ley de poder. Muchas de las que así habían sido descritas están siendo reexaminadas (algunos artículos sobre el tema).
El problema radica en que muchos estudios se apresuraron en buscar leyes de poder, sin contemplar otros modelos. Precisamente lo que se está encontrando ahora es que la distribución de conexiones en varias redes puede ser mejor descrita por otros modelos (ej. lognormal). De destacar el trabajo de Stumpf et al (1 y 2) y de Tanaka. En donde además de mostrar el "error" se proponen formas eficientes para evaluar modelos y examinar criticamente los resultados.
martes, noviembre 15, 2005
ECCS 2005 Sesion de la mañnana 15.11
Dos excelentes presentaciones:
Primera por Tamas Vicsek presentando su enfoque sobre extracción de comunidades en redes complejas, muy intereante. Básicamente lo que presentó se encuentra en su artículo de Nature. Para resaltar, está el hecho de que la forma de buscar comunidades propuestas acepta el sobrelapamiento de comunidades, un nodo puede pertenecer a mas de una comunidad, de la misma forma en que una persona, por ejemplo, pertenece a varias comunidades: profesionales, familia, deportes, etc. Esta es la principal diferencia con modelos anteriores jerárquicos en los que una vez un nodo dado es asignado a una comunidad, este ya no puede pertenecder a otra. La utilidad de este enfoque fue demostrada analizando redes de colaboración cientifica, asociación de palabras y de interacciónm de proteínas, con excelentes resultados.
En el caso de interacciones entre proteínas es interesante que el grupo de Vicsek encontró por un lado que diferentes comunidades a las que pertenece una protein, reflejan diferentes funciones, y por otro lado que encontrar que una proteina pertenece a una comundad dada podría azudar a asignar una función a esa proteína, algo que es de gran utilidad en la anotación de genomas.
Segunda por Henrik Lund de Dinamarca, presentando ¨Legos inteligentes¨, para ayudar en el desarrollo de habilidades cognitivas a niños con problemas de aprendizaje (dislexia) y/o para "combatir" los problemas de obesidad infantil, haciendo que los niños se muevan mas mientras juegan con robots.
Es un enfoque interesante, pero controversial. Parte de la idea de fomentar la actividad fisica, mediante el juego, en niños con el fin de dismunir la tasa de obesidad infantil, puede que cumpla con el fin, pero en el camino parte de la actividad creativa en el juego se pierde, y es el ¨lego¨quien dirige la actividad de manera autónoma . . . Claro, es un primer prototipo y seguramente esto podra recibir mas atención y otras forma de interacción prodrán ser implementadas.
Mas información se puede encontrar en www.adaptronics.dk.
Primera por Tamas Vicsek presentando su enfoque sobre extracción de comunidades en redes complejas, muy intereante. Básicamente lo que presentó se encuentra en su artículo de Nature. Para resaltar, está el hecho de que la forma de buscar comunidades propuestas acepta el sobrelapamiento de comunidades, un nodo puede pertenecer a mas de una comunidad, de la misma forma en que una persona, por ejemplo, pertenece a varias comunidades: profesionales, familia, deportes, etc. Esta es la principal diferencia con modelos anteriores jerárquicos en los que una vez un nodo dado es asignado a una comunidad, este ya no puede pertenecder a otra. La utilidad de este enfoque fue demostrada analizando redes de colaboración cientifica, asociación de palabras y de interacciónm de proteínas, con excelentes resultados.
En el caso de interacciones entre proteínas es interesante que el grupo de Vicsek encontró por un lado que diferentes comunidades a las que pertenece una protein, reflejan diferentes funciones, y por otro lado que encontrar que una proteina pertenece a una comundad dada podría azudar a asignar una función a esa proteína, algo que es de gran utilidad en la anotación de genomas.
Segunda por Henrik Lund de Dinamarca, presentando ¨Legos inteligentes¨, para ayudar en el desarrollo de habilidades cognitivas a niños con problemas de aprendizaje (dislexia) y/o para "combatir" los problemas de obesidad infantil, haciendo que los niños se muevan mas mientras juegan con robots.
Es un enfoque interesante, pero controversial. Parte de la idea de fomentar la actividad fisica, mediante el juego, en niños con el fin de dismunir la tasa de obesidad infantil, puede que cumpla con el fin, pero en el camino parte de la actividad creativa en el juego se pierde, y es el ¨lego¨quien dirige la actividad de manera autónoma . . . Claro, es un primer prototipo y seguramente esto podra recibir mas atención y otras forma de interacción prodrán ser implementadas.
Mas información se puede encontrar en www.adaptronics.dk.
Etiquetas:
comunidades,
conferencias,
ECCS,
lego,
redes
lunes, noviembre 14, 2005
ECCS 2005 Sesion de la tarde 14.11
Hubo una charla muy interesante en la sesión de la tarde. Fue presentada por Marc Barthelemy.
Los principales puntos de la charla fueron:
1. Hay mas que topología en una red. Hasta ahora la moyoria de modelos y descripciones de redes se han enfocado en la topología: distribución de probabilidad del grado de un vertice, clustering, etc.
2. Los pesos de los vinculos son importantes. Por ejemplo el tráfico en redes de transporte aéreo, los flujos heterogeneos en redes metabólicas, etc.
Puede ser diferente un nodo con muchos vinculos, pero poco tráfico por vínculo a uno con pocos vínculos pero con mucho tráfico por vínculo.
Los principales puntos de la charla fueron:
1. Hay mas que topología en una red. Hasta ahora la moyoria de modelos y descripciones de redes se han enfocado en la topología: distribución de probabilidad del grado de un vertice, clustering, etc.
2. Los pesos de los vinculos son importantes. Por ejemplo el tráfico en redes de transporte aéreo, los flujos heterogeneos en redes metabólicas, etc.
Puede ser diferente un nodo con muchos vinculos, pero poco tráfico por vínculo a uno con pocos vínculos pero con mucho tráfico por vínculo.
ECCS 2005 Introduccion
Hoy comenzó la "European Conference on Complex Systems", voy a tratar de mantener esta bitácora.
En la sección introductoria encontré tres aspectos que resultan bastante interesantes:
Uno de los coordinadores se referió brevemente a los disturbios que se han presentado en las ultimas semanas en Paris, lo interesante es el vínculo entre estos disturbios y los desarrollos de las tecnologías de la información en los últimos años. Sin Internet y Mensajes de Texto en los celulares difícilmente habrian habido disturbios. Una consecuencia de nuestra sociedad interconectada.
Michel Rocard, el anterior Primer Ministro Francés, parece estar sinceramente interesado en las ciencias de la complejidad, y en la manera en que estas pueden ayudar a resolver problemas reales, como por ejemplo, la creación de oportunidades de empleo sin incrementar la inflación, entre otras.
Georges Haddad, Científico que ha trabajado en complejidad y ahora Director de la División de Educacion Superior de la UNESCO, dió una charla interesante aunque un poco larga
Lo mas interesante fue una crítica a algunas imposiciones del Banco Monetario Internacional a algunos paises en vias de desarrollo. No recuerdo que paises mencionó, pero la obligación era crear 20000 posiciones para profesores universitarios en unos cuantos meses. Lo cual es una completa irresponsabilidad. Como se van a capacitar en pocos meses tantos
profesores, se va a sacrificar calidad por cantidad, desafortunadamente.
Eso fue lo mas interesante en la sesión de la mañana. En la tarde se inicia la sesión sobre modelado de redes, que voy a seguir a lo largo de estos tres días.
En la sección introductoria encontré tres aspectos que resultan bastante interesantes:
Lo mas interesante fue una crítica a algunas imposiciones del Banco Monetario Internacional a algunos paises en vias de desarrollo. No recuerdo que paises mencionó, pero la obligación era crear 20000 posiciones para profesores universitarios en unos cuantos meses. Lo cual es una completa irresponsabilidad. Como se van a capacitar en pocos meses tantos
profesores, se va a sacrificar calidad por cantidad, desafortunadamente.
Eso fue lo mas interesante en la sesión de la mañana. En la tarde se inicia la sesión sobre modelado de redes, que voy a seguir a lo largo de estos tres días.
martes, noviembre 01, 2005
Scriptoma (Scriptome)
El "scriptoma" es una colección de scripts en perl (one-liners) para el procesamiento de datos, que se ejecutan en la línea de comandos en cualquier sistema operativo, el único requisito es tener Perl instalado. Recientemente el scriptoma ha aparecido en varias fuentes de noticias (nodalpoint, perl.com), lo que motivo este post.
Yo vi los primeros mensajes sobre el proyecto en la lista de correo de bioperl, por allá en mayo de 2005, y empecé a usarlo hace un par de meses. Para mí el scriptoma ha sido de bastante utilidad. Yo me considero un usuario avanzado de perl, pero nunca le he prestado mucha atención a los one-liners, y este proyecto me presenta la oportunidad de llenar ese vacío.
El objetivo de los creadores del scriptoma es que biólogos no programadores (BNP) lo usen en sus tareas simples de procesamiento de datos. Tareas tales como: ordenar por la tercera columna en orden ascendente un archivo de texto separado por tabulaciones con 50000 registros, obtener un estadístico dado en la quinta columna, unir dos archivos mediante una clave común, extraer los casos comunes entre dos archivos, etc.
Puede resultar doloroso tratar de resolver algunas de estas tareas usando una hoja de cálculo, devido al elevado número de registos, en cambio con un pequeño script la tarea se lleva a cabo en unos poco segundos. Alternativamente para unir archivos mediante claves comunes uno podría usar MS-Access o cualquier otro cliente SQL (MySQL es mi favorito), pero la mayoría de los BNPs no están interesados en aprender a usar MS-Access, por un lado, y por otro, el scriptoma tiene un rango mucho mas amplio de utilidad.
Para los biólogos programadores el scriptoma es útil por que demuestra el poder de perl en una sola línea de comando, y se pueden aprender varios trucos y atajos de esta forma. Para los BNPs, cada script se puede usar como una caja negra (que es lo que generalmente los BNPs piden, quieren) a la que se le dan los datos en cierto formato y se obtiene un resultado, obviamente el resultado será bastante simple: ordenar una columna, obtener el valor medio de otra, etc. Pero este es necesariamente el primer paso para análisis mas interesantes.
No me cabe duda de que el scriptoma será de muchísima utilidad para los biólogos que vengan con intenciones de programar. En cambio, dudas aparecen en cuánto a la utilidad que le puedan prestar a los BNPs en la realidad, principalmente por el desdeño que muestran hacia el uso de computadores de formas inteligentes, muchas veces prefieren "cortar y pegar" por horas.
Yo vi los primeros mensajes sobre el proyecto en la lista de correo de bioperl, por allá en mayo de 2005, y empecé a usarlo hace un par de meses. Para mí el scriptoma ha sido de bastante utilidad. Yo me considero un usuario avanzado de perl, pero nunca le he prestado mucha atención a los one-liners, y este proyecto me presenta la oportunidad de llenar ese vacío.
El objetivo de los creadores del scriptoma es que biólogos no programadores (BNP) lo usen en sus tareas simples de procesamiento de datos. Tareas tales como: ordenar por la tercera columna en orden ascendente un archivo de texto separado por tabulaciones con 50000 registros, obtener un estadístico dado en la quinta columna, unir dos archivos mediante una clave común, extraer los casos comunes entre dos archivos, etc.
Puede resultar doloroso tratar de resolver algunas de estas tareas usando una hoja de cálculo, devido al elevado número de registos, en cambio con un pequeño script la tarea se lleva a cabo en unos poco segundos. Alternativamente para unir archivos mediante claves comunes uno podría usar MS-Access o cualquier otro cliente SQL (MySQL es mi favorito), pero la mayoría de los BNPs no están interesados en aprender a usar MS-Access, por un lado, y por otro, el scriptoma tiene un rango mucho mas amplio de utilidad.
Para los biólogos programadores el scriptoma es útil por que demuestra el poder de perl en una sola línea de comando, y se pueden aprender varios trucos y atajos de esta forma. Para los BNPs, cada script se puede usar como una caja negra (que es lo que generalmente los BNPs piden, quieren) a la que se le dan los datos en cierto formato y se obtiene un resultado, obviamente el resultado será bastante simple: ordenar una columna, obtener el valor medio de otra, etc. Pero este es necesariamente el primer paso para análisis mas interesantes.
No me cabe duda de que el scriptoma será de muchísima utilidad para los biólogos que vengan con intenciones de programar. En cambio, dudas aparecen en cuánto a la utilidad que le puedan prestar a los BNPs en la realidad, principalmente por el desdeño que muestran hacia el uso de computadores de formas inteligentes, muchas veces prefieren "cortar y pegar" por horas.
Suscribirse a:
Entradas (Atom)