<?xml version="1.0"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.2 20190208//EN" "JATS-journalpublishing1.dtd"[]>
<article xml:lang="en" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:mml="http://www.w3.org/1998/Math/MathML" dtd-version="1.2" article-type="research-article">
<front>
<journal-meta>
<journal-id journal-id-type="publisher-id">IJPDS</journal-id>
<journal-title-group>
<journal-title>International Journal of Population Data Science</journal-title>
<abbrev-journal-title>IJPDS</abbrev-journal-title>
</journal-title-group>
<issn pub-type="epub">2399-4908</issn>
<publisher>
<publisher-name>Swansea University</publisher-name>
</publisher>
</journal-meta>
<article-meta>
<article-id pub-id-type="doi">10.23889/ijpds.v11i5.3618</article-id>
<article-id pub-id-type="publisher-id">11:5:3618</article-id>
<article-id pub-id-type="pii">S2399490821036181</article-id>
<article-categories>
<subj-group subj-group-type="heading">
<subject>Population Data Science</subject>
</subj-group>
</article-categories>
<title-group>
<article-title>Mitigating Ethnoracial-Based Linkage Bias with Feature and Frequency-Aware Methods</article-title>
</title-group>
<contrib-group>
<contrib contrib-type="author"><name><surname>Lam</surname><given-names initials="J">Joseph</given-names></name><xref ref-type="aff" rid="affil-1"><sup>1</sup></xref></contrib>
<contrib contrib-type="author"><name><surname>Cortina-Borja</surname><given-names initials="M">Mario</given-names></name><xref ref-type="aff" rid="affil-1"><sup>1</sup></xref></contrib>
<contrib contrib-type="author"><name><surname>Blackburn</surname><given-names initials="R">Ruth</given-names></name><xref ref-type="aff" rid="affil-1"><sup>1</sup></xref></contrib>
<contrib contrib-type="author"><name><surname>Harron</surname><given-names initials="K">Katie</given-names></name><xref ref-type="aff" rid="affil-1"><sup>1</sup></xref></contrib>
<aff id="affil-1"><label>1</label><institution>UCL Great Ormond Street Institute of Child Health, London, United Kingdom</institution></aff>
</contrib-group>
<pub-date date-type="pub" publication-format="electronic"><day></day><month></month><year></year></pub-date>
<pub-date date-type="collection" publication-format="electronic"><year></year></pub-date>
<volume>11</volume>
<issue>5</issue>
<elocation-id>3618</elocation-id>
<permissions>
<license license-type="open-access" xlink:href="https://creativecommons.org/licenses/by-nc-nd/4.0/">
<license-p>This work is licensed under a Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License.</license-p>
</license>
</permissions>
<self-uri xlink:href="https://ijpds.org/article/view/3618">This article is available from the IJPDS website at: https://ijpds.org/article/view/3618</self-uri>
<abstract>
<p>Record linkage using names as identifiers is central to population data integration yet may systematically disadvantage minoritised ethnoracial groups. We investigate how ethnoracial-based differences in name characteristics and error distributions interact with probabilistic linkage models to produce unequal missed match rates, and whether feature-based methods can mitigate this bias. Using 8.7 million records from the North Carolina Voter Registry, we derive race-specific error profiles and simulate three data corruption scenarios, including a biased setting with higher corruption among minoritised groups. We compare three linkage strategies within a mixed, cluster-based framework: (i) conventional probabilistic linkage using Jaro–Winkler and Levenshtein similarities; (ii) rarity-aware variants with term-frequency (TF) adjustment; and (iii) a proposed name-feature model combining principal-component embeddings of first-name characteristics with TF-adjusted last-name similarity. Across all settings, we fix the overall false negative rate at 20% and quantify group-specific false match rates differences relative to Non-Hispanic White voters. Baseline probabilistic models exhibit clear ethnoracial bias mechanisms: Non-Hispanic White individuals consistently have the lowest false negative rates, with larger missed-match penalties for Non-Hispanic Black, Asian, and Hispanic groups under race-specific error patterns. Term-frequency adjustment reduces but does not eliminate ethno-racial disparities. The name-feature model yields the most equitable outputs, minimising false negative rate gaps across racial groups in the most realistic corruption scenario, with modest increases in false match rate. Distribution-aware name features and rarity adjustment can be embedded in cluster-based linkage to reduce ethnic bias in name-based linkage without substantial loss of accuracy.</p>
</abstract>
</article-meta>
</front>
</article>