NCBI taxonomy ID (any level) to genomes (assemblies)

¿Necesitas obtener los genomas (ensambles) de todas las especies asociadas a algún taxid (cualquier nivel taxonómico)?, este es tu post. Primero es necesario tener el taxid que nos interesa. En este caso usaré el taxid de una familia de virus llamada Birnaviridae. Si seguimos este link, veremos que a la fecha existen 23 ensambles asociados […]

Tips para procesar archivo fastq

Estos son algunos TIPs para manipular archivos fastq Concatenar por ID El comando "paste" permite "contatenar" el contenido del fastq de cada ID en una sola línea, es decir, las cuatro líneas de cada ID quedarán "unidas" en una sola línea, separadas por tabulador. Obtener lista de IDs Usando el comando "paste", junto con otros […]

Transformar anotación GOs de genes a un archivo GAF

Para realizar un análisis de enriquecimiento funcional necesitamos en muchos casos un archivo GAF (por ejemplo en ontologizer). Acá te explico la forma de obtenerlo si cuentas con la anotación GO de tus genes. 1. ¿Qué es un archivo GAF? El archivo GAF (Gene Association File) es una forma de almacenar la información de anotación funcional de […]

Consejos para alineamiento múltiple de secuencias

Estos son mis TIPs para situaciones de alineamiento múltiple de secuencias Orientación de secuencias Algo extremadamente impotante a la hora de realizar un alineamiento múltiple es que todas las secuencias estén en la misma orientación. Cuando son 2 a 3 secuencias, la dirección se puede "ajustar" de forma manual mediante un alineamiento con blast (align2seqs) […]

Setup de datos para STAMP

Quienes conocen STAMP saben lo útil que es para analizar datos de microbioma y similares. Lamentablemente no es muy popular debido a que no es fácil preparar el input de datos. Acá escribiré mis consejos para preparar el input y para usar STAMP. Requisitos Debes tener un Excel con la tabla de abundancia y taxonomía […]

NCBI taxonomy ID and lineage

¿Necesitas obtener el taxid de una o varias secuencias de NCBI y/o necesitas conocer su linage completo (taxonomía de siete niveles)? este es tu post. Primero es necesario tener una lista de IDs de las secuencias de NCBI que te interesan. Supondré que el listado lo tienes en un archivo que se llama IDs.txt (típicamente […]

BLAST: Ejemplos de comandos

Esta es una recopilación de los comandos que acostumbro a usar al momento de hacer una búsqueda por homología con BLAST. Los ejemplos están hechos en base a un blastn (nucleotídos contra nucleótidos) pero pueden ser adaptados a otros tipos de BLAST según el requerimiento. 1. Instalar BLAST en Ubuntu (o en Windows con WSL […]

Programas/scripts recomendados para trabajo con secuencias

Cada herramienta que recomiendo en este post tiene su propio sitio web con explicaciones de instalación y uso, asi que sólo me remitiré a dar lainformación general con algunos comandos de ejemplos y Uds podrás revisar los links para los detalles. seqtk Permite convertir FASTQ a FASTA, reverso complementar, extraer secuencias usando archivo con IDs, […]

ncbi EDirect efetch ubuntu install

Edirect es un conjunto de herrramientas proporcionadas por NCBI para hacer mas fácil la descarga de secuenciasy todo tipo de indormación desde NCBI. Una de las que más uso es efetch, un wrapper que permite descargas secuencias usando el GenBank number o cualquier tipo de código que identifique una seccuencia. Download and install EDirect following […]