El contenido de GC — la proporción de una secuencia de ADN compuesta por guanina y citosina — es uno de los descriptores más básicos de un fragmento de ADN, pero aparece en todas partes, desde el diseño de cebadores de PCR hasta las comparaciones a nivel de genoma entre especies. Esta calculadora cuenta bases, calcula GC% y AT%, y muestra la composición completa para que puedas leer una secuencia de un vistazo.

Por qué importa el contenido de GC en biología molecular

Cada par de bases en el ADN se mantiene unido por puentes de hidrógeno: G se aparea con C usando tres puentes de hidrógeno, mientras que A se aparea con T usando solo dos. Ese puente extra significa que el ADN rico en GC es más estable térmicamente y tiene una temperatura de fusión más alta que el ADN rico en AT de la misma longitud — que es exactamente por qué el contenido de GC es un dato estándar de entrada para el diseño de cebadores de PCR, el diseño de sondas, y la predicción de cómo se comportará una secuencia bajo condiciones de calor o desnaturalización.

El contenido de GC también varía ampliamente entre organismos e incluso entre regiones del mismo genoma — algunos genomas bacterianos se sitúan por encima del 70% de GC mientras que otros están por debajo del 30%, y dentro de un solo genoma, las regiones codificantes y las regiones regulatorias a menudo difieren en contenido de GC respecto a la secuencia circundante. Esa variación hace del contenido de GC una señal rápida útil en la anotación de genomas, la identificación de especies, y la genómica comparativa.

Cómo se manejan las bases ambiguas

Los datos de secuencia del mundo real no siempre son una cadena limpia de A, T, G y C. Los archivos FASTA, las lecturas de secuenciación y las secuencias de consenso a menudo incluyen códigos de ambigüedad IUPAC como N (cualquier base), R, Y, S, W, K, o M (cada uno representando dos bases posibles), especialmente donde un resultado de secuenciación fue incierto. Esta calculadora cuenta cada carácter que pegas, pero solo A, T, G y C contribuyen alguna vez al denominador de GC% y AT% — todo lo demás se contabiliza por separado como "otro / ambiguo" para que nunca sesgue silenciosamente los porcentajes.

La herramienta también es insensible a mayúsculas/minúsculas y elimina todos los espacios en blanco antes de contar, así que pegar una secuencia con formato FASTA con saltos de línea (después de eliminar la línea de encabezado ">") funciona exactamente igual que pegar una sola cadena continua.

Límites de esta herramienta

Esta calculadora es una verificación rápida de composición y GC%, no un conjunto completo de herramientas bioinformáticas — no alinea secuencias, no detecta islas CpG, ni calcula un gráfico de GC de ventana deslizante a lo largo de un genoma largo. La estimación de temperatura de fusión usa la simple regla de Wallace, que es más precisa para oligos cortos (aproximadamente menos de 14 nucleótidos) y cada vez más aproximada para secuencias más largas, donde los modelos termodinámicos ajustados por sal o de vecino más cercano son más precisos. Para el diseño de cebadores o trabajo de laboratorio, verifica los resultados con software dedicado de diseño de cebadores o análisis de secuencias.