En esta sesión vamos a trabajar sobre los pasos que nos faltan para realmente terminar un análisis completo de descubrimiento de palabras reguladoras. Así que primero pensemos en el ejercicio anterior. Dado un conjunto universo y una muestra de secuencias, pudimos identificar una palabra sobre-representada en la muestra. Pero, qué hacemos con esa palabra? Normalmente de dónde sacamos el universo, las secuencias, la muestra? Estas son las preguntas que vamos a tratar de contestar ahora.
Para esta práctica conviene tener completamente funcional nuestro programa de la práctica anterior. Los siguientes ejercicios podemos irlos solucionando “modularmente”, es decir, en programitas independientes. Por lo mismo, no vienen en ningún orden lógico, si no más bien en orden de complejidad. Al final de todas maneras buscaremos integrar todo en un solo programa.
• A qué microRNA podría corresponder una palabra enriquecida? Para esto necesitamos dos cosas:• Entonces, para la palabra GCATTA que encontraron como enriquecida, qué microRNA de ratón se le puede unir?
- Las secuencias de los microRNAs
Estas las podemos descargar de miRBase. En particular el archivo que necesitamos es el que contiene las secuencias de los microRNAs maduros, que son los que interactúan con los transcritos: mature.fa.gz. Vale la pena recordar que en el experimento que hemos analizado se usó al ratón como organismo de estudio. El archivo anterior contiene secuencias para todas las especies que están en miRBase.- Saber cómo interactúan los microRNAs con su transcrito blanco
Dicen que una imagen vale más que mil palabras (ojo con la dirección de la cadena): cel-let-7-5p MIMAT0000001 Caenorhabditis elegans let-7-5p 1 2 3 4 5 6 7 8 9 (5') U G A G G U A G U A G G U U G U A U A G U U (3') | | | | | | C U C C A U (3') N N N N N N N N N N N N N N N N N N N N N N N (5') fragmento de un posible transcrito blanco
• Cómo obtenemos secuencias para genes o transcritos detectados en un microarreglo? Hay muchísimas maneras de abordar esta pregunta. En este caso nos vamos a concentrar en aprender a usar un paquete de Bioconductor llamado biomaRt. Siguiendo con esta modalidad de aprendizaje, van a tener que averiguar por su lado cómo usar biomaRt. Para ello podemos tener una discusión breve en clase y luego pueden seguir los siguientes pasos:
- Conviene conocer en términos generales la información disponible en Ensembl
- Antes de usar la interfaz de R, podemos explorar la interfaz web de Biomart
- Tienen que tener instalado el paquete biomaRt y poder ver su manual o vignette:
library(biomaRt) openVignette(package="biomaRt") Eso debe permitirles abrir el vignette en formato PDF, pero si no funciona, también pueden accesar aquí el PDF.- Les recomiendo revisar por encima las primeras 3 secciones (Introduction, Selecting..., How to...)
- Los ejemplos que más se acercan a lo que queremos hacer son el Task 1 y Task 7-8. Conviene revisarlos para después tratar de contestar lo siguiente:
- Obtengan los ensembl_transcript_id que corresponden a las siguientes sondas del chip affy_mouse430_2 de Affymetrix:
"1416557_a_at", "1417085_at", "1418600_at", "1422440_at", "1422933_at", "1423545_a_at", "1423676_at", "1425513_at", "1428513_at", "1429796_at"- Para los transcritos del paso anterior, obtengan la secuencia 3utr para cada uno de ellos.
- Eliminen sondas duplicadas y transcritos que no tengan secuencia para generar una tabla que relacione sonda, transcrito y secuencia de forma no-redundante.
- Se les ocurre cómo modificar su programa para ahora obtener todas las sondas, transcritos y secuencias 3utr del genoma del ratón? No lo hagan realmente, pues el internet es algo lento...