Genetic Distance Calculators
0 calculators tagged with “Genetic Distance”
All Calculators
No calculators found for this topic.
What Is Genetic Distance?
Genetic distance quantifies how different two DNA sequences or two populations are genetically. At the sequence level, the simplest measure — p-distance — counts the fraction of nucleotide sites that differ. More sophisticated models correct for multiple substitutions at the same site, which can cause underestimation at high divergence.
Common Nucleotide Distance Measures
p-Distance (Observed Divergence)
p = n_d / n
Where n_d = number of different nucleotide sites and n = total compared sites. Simple but underestimates true divergence at high p (>0.1) due to back-mutations and multiple hits.
Jukes-Cantor (JC69) Distance
d = −(3/4) × ln(1 − (4/3)p)
Assumes equal base frequencies and equal substitution rates for all base pairs. Corrects for multiple hits at the same site.
Kimura 2-Parameter (K80) Distance
d = −(1/2) ln(1 − 2P − Q) − (1/4) ln(1 − 2Q)
Where P = proportion of transition differences and Q = proportion of transversion differences. Accounts for higher transition rate than transversion rate (more biologically realistic than JC).
Population-Level Genetic Distance
Between populations, distance measures are based on allele frequency differences:
- Nei's standard genetic distance (D): D = −ln(J_AB / √(J_A × J_B)), where J = normalized identity in allele frequencies. D = 0 = identical; increases with divergence.
- FST-based distance: Directly uses FST between populations
Applications
- Phylogenetic tree construction (neighbor-joining, UPGMA, maximum likelihood)
- Molecular clock dating using distance + substitution rate
- Population structure and conservation genetics
- Forensic identification and kinship analysis
Glossary
Frequently Asked Questions
Genetic distance quantifies genetic divergence between sequences or populations. At the sequence level, p-distance = (number of differing sites) / (total sites compared) — the simplest measure. More accurate models (Jukes-Cantor, Kimura 2-parameter) correct for multiple hits at the same site, which cause p-distance to underestimate true divergence at high values. Model selection depends on sequence divergence level and observed transition-transversion ratio.
p-distance simply counts the proportion of sites that differ — it underestimates true evolutionary distance because it ignores multiple substitutions at the same site (back-mutations, parallel mutations). The Kimura 2-parameter (K80) model explicitly accounts for the higher rate of transitions vs. transversions and corrects for multiple hits. K80 distance = −(1/2)ln(1−2P−Q) − (1/4)ln(1−2Q), where P = transition proportion and Q = transversion proportion. K80 is more accurate for sequences with >5% divergence.
Genetic distance is used to construct phylogenetic trees via distance-based methods: neighbor-joining (NJ) and UPGMA use pairwise distance matrices to cluster taxa by similarity. Lower distance = more recently diverged (shorter branch lengths). Distance methods are fast and work well for large datasets, though they lose information compared to character-based methods (maximum likelihood, Bayesian inference). Distances are also used directly in molecular clock analyses: divergence time = genetic distance / (2 × substitution rate).
Nei's standard genetic distance (D) measures genetic divergence between populations using allele frequency data from multiple loci: D = −ln(J_AB/√(J_A × J_B)), where J values are normalized allele frequency identities. D = 0 means populations have identical allele frequencies; D increases with genetic divergence. Nei's distance is used in population genetics to measure how different populations are, estimate divergence times, and construct population trees. It is especially useful for microsatellite or allozyme data from multiple loci.