Una de las estrategias comúnmente empleadas en el estudio de ARN no codificantes, es estimar la "energía mínima de plegamiento (MFE por sus siglas en inglés)" de la estructura secundaria del ARN candidato. Este enfoque se basa en el hecho de que en muchos ARN no codificantes la estructura secundaria de la molécula es importante para su desempeño en el sistema biológico.
Usualmente la MFE estimada se compara con la MFE de secuencias al azar derivadas por re-ordenamiento de la secuencia original de ARN ("nucleotide suffling"). La hipótesis subyacente es que ARN no codificantes funcionales tendrán una estructura secundaria más estable (con menor MFE) que la predicha para una secuencia al azar de la misma composición nucleótidica.
La hipótesis funcionaría bien si los programas de predicción de estructuras secundarias fuesen completamente independientes de los sesgos en el contenido se bases nucléotidicas en las secuencias. Desafortunadamente esto no ocurre. La predicción de estructuras secundarias se basa en observaciones experimentales de la energía libre de di-nucleótidos apilados, de forma que la composición de di-nucleótidos en la secuencia es un factor que tiene que ser controlado en el experimento computacional.
La forma de controlar por el efecto de la composición de di-nucleótidos es generando secuencias al azar en donde esta composición sea idéntica (de forma exacta o estadísticamente) a la de la secuencia original. De forma que si la MFE es realemente significativa, y no solo efecto del sesgo di-nucleótidico, esta será (estadísticamente) menor que la de la secuencia al azar.
La generación de secuencias al azar que conservan la composición de di-nucleótidos es un poco mas complicada que aquella en donde solo la composición de monómeros es preservada. En 1985 Altschul y Erickson desarrollaron un algoritmo para generar este tipo de secuencias aleatorias, del cual hay varias implementaciones. Una de ellas, en perl, esta disponible en MacResearch.
Así que no olvidar generar secuencias al azar que conserven la composición de di-nucleótidos cuando se analice la estabilidad de estructuras secundarias de ARN.
Mostrando las entradas con la etiqueta programación. Mostrar todas las entradas
Mostrando las entradas con la etiqueta programación. Mostrar todas las entradas
lunes, junio 04, 2007
miércoles, marzo 21, 2007
OpenKapow
Conocí openkapow por un artículo en el blog de Pedro Beltrao, e inmediatamente decidí ensayarlo y ver que posibilidades brindaba.
Básicamente, openkapow sirve para reunir datos de diferentes sitios web en forma sistemática.
Yo tenía el siguiente poblema: necesitaba obtener la ubicacíon en el borrador del genoma de Chlamydomonas reinhardtii para cada uno de los factores de transcripción que aparecen en ChlamyTFDB.
La información sobre la ubicación en el genoma está en páginas web del JGI/DOE, y cada uno de los factores de transcripción en ChlamyTFDB tiene un hipervínculo a la página del JGI/DOE apropiada.
Claro, esta tarea se puede resolver usando, por ejemplo, scripts de PERL, pero eso significa una inversión significativa de tiempo, planenado, escribiendo y corrigiendo el script. Y aquí es donde openkapow nos ayuda.
Mediante una interface gráfica, Openkapow, permite construir paso a paso las acciones requeridas para navegar diferentes páginas, extraer datos usando el puntero del ratón y cliqueando, y exportar los datos a la web o archivos de texto locales en formato CSV, XML o HTML.
Creo que el único requisito para usar OpenKapow es poder estructurar el problema en forma programática, luego es aplicar la estructura en la interace de OpenKapow, incluso añadiendo control de errores, entrada de datos, y filtrado de resultados basado en expresiones regulares, si se desea.
En realidad me parece una excelente herramienta y se las recomiendo.
Básicamente, openkapow sirve para reunir datos de diferentes sitios web en forma sistemática.
Yo tenía el siguiente poblema: necesitaba obtener la ubicacíon en el borrador del genoma de Chlamydomonas reinhardtii para cada uno de los factores de transcripción que aparecen en ChlamyTFDB.
La información sobre la ubicación en el genoma está en páginas web del JGI/DOE, y cada uno de los factores de transcripción en ChlamyTFDB tiene un hipervínculo a la página del JGI/DOE apropiada.
Claro, esta tarea se puede resolver usando, por ejemplo, scripts de PERL, pero eso significa una inversión significativa de tiempo, planenado, escribiendo y corrigiendo el script. Y aquí es donde openkapow nos ayuda.
Mediante una interface gráfica, Openkapow, permite construir paso a paso las acciones requeridas para navegar diferentes páginas, extraer datos usando el puntero del ratón y cliqueando, y exportar los datos a la web o archivos de texto locales en formato CSV, XML o HTML.
Creo que el único requisito para usar OpenKapow es poder estructurar el problema en forma programática, luego es aplicar la estructura en la interace de OpenKapow, incluso añadiendo control de errores, entrada de datos, y filtrado de resultados basado en expresiones regulares, si se desea.
En realidad me parece una excelente herramienta y se las recomiendo.
martes, noviembre 01, 2005
Scriptoma (Scriptome)
El "scriptoma" es una colección de scripts en perl (one-liners) para el procesamiento de datos, que se ejecutan en la línea de comandos en cualquier sistema operativo, el único requisito es tener Perl instalado. Recientemente el scriptoma ha aparecido en varias fuentes de noticias (nodalpoint, perl.com), lo que motivo este post.
Yo vi los primeros mensajes sobre el proyecto en la lista de correo de bioperl, por allá en mayo de 2005, y empecé a usarlo hace un par de meses. Para mí el scriptoma ha sido de bastante utilidad. Yo me considero un usuario avanzado de perl, pero nunca le he prestado mucha atención a los one-liners, y este proyecto me presenta la oportunidad de llenar ese vacío.
El objetivo de los creadores del scriptoma es que biólogos no programadores (BNP) lo usen en sus tareas simples de procesamiento de datos. Tareas tales como: ordenar por la tercera columna en orden ascendente un archivo de texto separado por tabulaciones con 50000 registros, obtener un estadístico dado en la quinta columna, unir dos archivos mediante una clave común, extraer los casos comunes entre dos archivos, etc.
Puede resultar doloroso tratar de resolver algunas de estas tareas usando una hoja de cálculo, devido al elevado número de registos, en cambio con un pequeño script la tarea se lleva a cabo en unos poco segundos. Alternativamente para unir archivos mediante claves comunes uno podría usar MS-Access o cualquier otro cliente SQL (MySQL es mi favorito), pero la mayoría de los BNPs no están interesados en aprender a usar MS-Access, por un lado, y por otro, el scriptoma tiene un rango mucho mas amplio de utilidad.
Para los biólogos programadores el scriptoma es útil por que demuestra el poder de perl en una sola línea de comando, y se pueden aprender varios trucos y atajos de esta forma. Para los BNPs, cada script se puede usar como una caja negra (que es lo que generalmente los BNPs piden, quieren) a la que se le dan los datos en cierto formato y se obtiene un resultado, obviamente el resultado será bastante simple: ordenar una columna, obtener el valor medio de otra, etc. Pero este es necesariamente el primer paso para análisis mas interesantes.
No me cabe duda de que el scriptoma será de muchísima utilidad para los biólogos que vengan con intenciones de programar. En cambio, dudas aparecen en cuánto a la utilidad que le puedan prestar a los BNPs en la realidad, principalmente por el desdeño que muestran hacia el uso de computadores de formas inteligentes, muchas veces prefieren "cortar y pegar" por horas.
Yo vi los primeros mensajes sobre el proyecto en la lista de correo de bioperl, por allá en mayo de 2005, y empecé a usarlo hace un par de meses. Para mí el scriptoma ha sido de bastante utilidad. Yo me considero un usuario avanzado de perl, pero nunca le he prestado mucha atención a los one-liners, y este proyecto me presenta la oportunidad de llenar ese vacío.
El objetivo de los creadores del scriptoma es que biólogos no programadores (BNP) lo usen en sus tareas simples de procesamiento de datos. Tareas tales como: ordenar por la tercera columna en orden ascendente un archivo de texto separado por tabulaciones con 50000 registros, obtener un estadístico dado en la quinta columna, unir dos archivos mediante una clave común, extraer los casos comunes entre dos archivos, etc.
Puede resultar doloroso tratar de resolver algunas de estas tareas usando una hoja de cálculo, devido al elevado número de registos, en cambio con un pequeño script la tarea se lleva a cabo en unos poco segundos. Alternativamente para unir archivos mediante claves comunes uno podría usar MS-Access o cualquier otro cliente SQL (MySQL es mi favorito), pero la mayoría de los BNPs no están interesados en aprender a usar MS-Access, por un lado, y por otro, el scriptoma tiene un rango mucho mas amplio de utilidad.
Para los biólogos programadores el scriptoma es útil por que demuestra el poder de perl en una sola línea de comando, y se pueden aprender varios trucos y atajos de esta forma. Para los BNPs, cada script se puede usar como una caja negra (que es lo que generalmente los BNPs piden, quieren) a la que se le dan los datos en cierto formato y se obtiene un resultado, obviamente el resultado será bastante simple: ordenar una columna, obtener el valor medio de otra, etc. Pero este es necesariamente el primer paso para análisis mas interesantes.
No me cabe duda de que el scriptoma será de muchísima utilidad para los biólogos que vengan con intenciones de programar. En cambio, dudas aparecen en cuánto a la utilidad que le puedan prestar a los BNPs en la realidad, principalmente por el desdeño que muestran hacia el uso de computadores de formas inteligentes, muchas veces prefieren "cortar y pegar" por horas.
Suscribirse a:
Entradas (Atom)