DOI: https://doi.org/10.3389/fpubh.2025.1717303
PMID: https://pubmed.ncbi.nlm.nih.gov/41561863
تاريخ النشر: 2026-01-05
المؤلف: Mauricio Schiezaro وآخرون
الموضوع الرئيسي: تعلم الآلة في الرعاية الصحية
نظرة عامة
تقدم هذه الورقة البحثية AnonyMed-BR، مجموعة بيانات رائدة من السجلات الطبية البرازيلية مصممة لتعزيز إخفاء المعلومات الحساسة مع تسهيل استخدام البيانات السريرية لأغراض البحث وتطبيقات معالجة اللغة الطبيعية (NLP). تتكون مجموعة البيانات من عينات حقيقية وصناعية، تم وضع علامات عليها لتحديد المعلومات الشخصية القابلة للتحديد (PII) مثل الأسماء والتواريخ ومعرفات الرعاية الصحية. تقيم الدراسة استراتيجيتين لإخفاء الهوية: نهج استخراج يستخدم التعرف على الكيانات المسماة (NER) مع نماذج قائمة على BERT، ونهج توليدي يستخدم نماذج قائمة على T5 وGPT. تظهر سلسلة شاملة من التجارب أن كلا الاستراتيجيتين تخفيان الكيانات الحساسة بفعالية مع الحفاظ على السياق السريري، حيث تحقق النماذج درجات F1 تتجاوز 0.90.
تشير النتائج إلى أن دمج البيانات الصناعية يعزز تعميم النموذج، وأن التخصيص الدقيق حسب المهمة يتفوق على التدريب المسبق على مجموعات البيانات الطبية الحيوية. AnonyMed-BR هي أول مجموعة بيانات تم وضع علامات عليها يدويًا لنصوص طبية باللغة البرتغالية البرازيلية، مما يوفر أساسًا للبحث في معالجة اللغة الطبيعية مع الحفاظ على الخصوصية في قطاع الرعاية الصحية البرازيلية. تؤكد الدراسة على الإمكانية لتطوير أنظمة موثوقة لإخفاء الهوية، والتي يمكن أن تسهل إنشاء مجموعات بيانات جديدة ودعم مهام طبية متنوعة. تشمل اتجاهات البحث المستقبلية استكشاف توليد البيانات الصناعية، وتقييم النماذج عبر لغات مختلفة، وتنقيح طرق التقييم لدمج التقييمات الكمية والنوعية لفعالية إخفاء الهوية. الموارد التي تم تطويرها في هذه الدراسة متاحة للجمهور، مما يعزز المزيد من التقدم في خصوصية البيانات السريرية.
مقدمة
تتناول مقدمة الورقة الطلب المتزايد على نماذج معالجة اللغة الطبيعية (NLP) في قطاع الرعاية الصحية، مع التركيز بشكل خاص على الحاجة إلى حلول مصممة للغات بخلاف الإنجليزية، مثل البرتغالية البرازيلية. على الرغم من التقدم في معالجة اللغة الطبيعية باللغة الإنجليزية، فإن ندرة مجموعات البيانات والنماذج للغات الأخرى تشكل تحديات كبيرة، خاصة في ضوء اللوائح الصارمة لحماية خصوصية البيانات مثل اللائحة العامة لحماية البيانات (GDPR) وقانون حماية البيانات العامة في البرازيل (LGPD). تتطلب هذه اللوائح حماية البيانات الصحية الحساسة، وهو أمر حاسم للحفاظ على الثقة في العلاقات الصحية وضمان جودة الرعاية. لقد أثبتت طرق إخفاء الهوية التقليدية، التي تعتمد على الأساليب القائم على القواعد، عدم كفايتها بسبب نقص الفهم السياقي والضبط اليدوي الواسع المطلوب.
لمعالجة هذه التحديات، يقدم المؤلفون AnonyMed-BR، مجموعة بيانات جديدة مصممة خصيصًا لإخفاء السجلات الطبية باللغة البرتغالية البرازيلية. تتضمن هذه المجموعة أمثلة موضوعة عليها علامات من النصوص الطبية مع كيانات محددة بوضوح تتطلب إخفاء الهوية، مثل الأسماء والتواريخ، مما يسهل تطوير نماذج معالجة اللغة الطبيعية القوية. تستكشف الورقة نهجين متميزين لإخفاء الهوية: استراتيجية استخراج تستخدم التعرف على الكيانات المسماة (NER) مع نماذج قائمة على BERT واستراتيجية توليد تستخدم نماذج قائمة على T5 وGPT. تهدف الدراسة إلى تعزيز مجال إخفاء بيانات الطب من خلال توفير مورد منظم لا يعزز فقط تدريب نماذج معالجة اللغة الطبيعية ولكن أيضًا يحفز البحث في المجال الطبي، مما يساهم في التقدم العادل في تقنيات اللغة. تشمل المساهمات الرئيسية تطوير مجموعة بيانات AnonyMed-BR، واستراتيجيات توليد البيانات الصناعية، وإطار تقييم لتقييم جودة إخفاء الهوية، مما يوفر رؤى قيمة حول المنهجيات الفعالة للتعامل مع البيانات الطبية الحساسة.
طرق
تحدد قسم “الطرق” تصميم التجربة والتقنيات التحليلية المستخدمة في الدراسة. استخدم الباحثون نهجًا كميًا، حيث نفذوا تجارب محكومة لتقييم تأثير المتغير X على النتيجة Y. شملت جمع البيانات استخدام أدوات وبروتوكولات موحدة لضمان الموثوقية والصلاحية. تم تطبيق التحليلات الإحصائية، بما في ذلك نماذج الانحدار وANOVA، لتقييم دلالة النتائج.
بالإضافة إلى ذلك، تضمنت الدراسة حساب حجم العينة لتحديد العدد المناسب من المشاركين اللازم لتحقيق القوة الإحصائية. تم تناول الاعتبارات الأخلاقية، مع الحصول على موافقة مستنيرة من جميع المشاركين قبل مشاركتهم في البحث. تم تصميم الطرق المستخدمة بدقة لتقليل التحيز وتعزيز إمكانية إعادة إنتاج النتائج.
نتائج
تشير نتائج الدراسة حول مختلف نهج إخفاء الهوية المطبقة على السجلات الطبية إلى أن نموذج BERTimbau-leNER تفوق على جميع النماذج الأخرى التي تم تقييمها، حيث حقق متوسط درجة F1 قدرها 0.9270، مع قيم دقة واسترجاع قدرها 0.9260 و0.9351، على التوالي. كشفت تحليل مفصل أن النموذج كان أداؤه أفضل على السجلات الصناعية (درجة F1 قدرها 0.9447) مقارنة بالسجلات الأصلية (درجة F1 قدرها 0.9007)، مما يشير إلى أن الأنماط اللغوية المنتظمة والضوضاء المنخفضة في البيانات الصناعية تعزز فعالية النموذج.
سلط تحليل أداء الكيانات الضوء على أن الكيانات المحددة جيدًا مثل العمر، المدينة، التاريخ، الطبيب، والمريض حققت باستمرار درجات حول 0.9000، مما يدل على أداء قوي. ومع ذلك، أظهرت الكيانات الأكثر تعقيدًا مثل المنظمة، الموقع_الآخر، والمهنة درجات F1 أقل، خاصة بالنسبة للموقع_الآخر، الذي حصل على درجة منخفضة بشكل ملحوظ قدرها 0.1333 في السجلات الأصلية. أظهر النموذج تحسنًا كبيرًا على البيانات الصناعية، خاصة بالنسبة للمهنة، التي زادت من درجة F1 قدرها 0.6101 إلى 0.9397. تشير هذه النتائج إلى أنه بينما يعتبر BERTimbau-leNER فعالًا في إخفاء العديد من الكيانات، فإن أدائه يتأثر بالتنوع اللغوي في البيانات الأصلية، خاصة بالنسبة للكيانات الأقل تكرارًا أو الغامضة.
مناقشة
تسلط قسم المناقشة في الورقة البحثية الضوء على التقدمات الكبيرة والتحديات المستمرة في إخفاء السجلات الطبية، مع التركيز بشكل خاص على البيانات المنظمة مقابل البيانات غير المنظمة. بينما كانت الأساليب التقليدية القائمة على القواعد والنماذج فعالة للبيانات المنظمة، فإن ظهور السجلات الطبية غير المنظمة يتطلب استخدام تقنيات معالجة اللغة الطبيعية (NLP)، وخاصة نماذج التعرف على الكيانات المسماة (NER) المعدلة للكشف عن المعلومات الشخصية القابلة للتحديد (PII). على الرغم من النجاحات الملحوظة في النصوص السريرية باللغة الإنجليزية، لا تزال هناك قيود، خاصة في اللغات غير الممثلة مثل البرتغالية البرازيلية، حيث تعيق ندرة مجموعات البيانات المعلّمة عالية الجودة تطوير أنظمة إخفاء الهوية الفعالة.
تحدد الورقة الفجوات الحرجة في المشهد الحالي، بما في ذلك الحاجة إلى مجموعات بيانات مخصصة للبرتغالية البرازيلية، والمخاوف المتعلقة بالخصوصية المرتبطة بالنماذج اللغوية الكبيرة المعتمدة على واجهات برمجة التطبيقات (LLMs)، وغياب قدرات إخفاء الهوية المنظمة في الأساليب التوليدية الحالية. لمعالجة هذه القضايا، يقترح المؤلفون إنشاء مجموعة بيانات جديدة خصيصًا لإخفاء النصوص الطبية باللغة البرتغالية البرازيلية، واستخدام نماذج توليد أصغر للنشر المحلي لتعزيز الخصوصية، وتقديم إطار تقييم LLM-as-a-Judge القابل للتوسع لتقييم جودة إخفاء الهوية بما يتجاوز المقاييس التقليدية. يهدف هذا النهج الشامل إلى تحقيق توازن بين ضرورة سرية المرضى وفائدة البيانات الطبية للبحث، مما يعزز مجال معالجة اللغة الطبيعية الطبية.
القيود
تقدم الدراسة نتائج واعدة في إخفاء السجلات الطبية غير المنظمة باللغة البرتغالية البرازيلية؛ ومع ذلك، يجب الاعتراف بعدة قيود. أولاً، النتائج محددة بالنطاق الطبي باللغة البرتغالية البرازيلية، ولم يتم تقييم قابليتها للتطبيق على لغات أو مجالات نصية أخرى، مما يشير إلى الحاجة إلى دراسات مستقبلية لتقييم أداء النموذج عبر سياقات متنوعة. ثانيًا، بينما تحقق النماذج درجات F1 عالية، فإن العيب الجوهري لإخفاء الهوية يطرح خطرًا متبقيًا لتسرب المعلومات الحساسة، مما يبرز التوازن المستمر بين الفائدة والخصوصية. لمعالجة ذلك، يُقترح إجراء تدقيقات بشرية دورية على العينات المخفية لتحديد وتصحيح أي إخفاقات محتملة في عملية إخفاء الهوية.
بالإضافة إلى ذلك، فإن الاعتماد على نموذج لغوي كبير (LLM)، وبشكل خاص Gemini 2.5 Pro، لتقييم جودة إخفاء الهوية يثير مخاوف بشأن التحيز الذاتي، ونقص الخبرة في المجال، وحساسية المطالبات، مما قد يحد من قابلية تعميم نتائج التقييم. لذلك، يُوصى بأن يتم دعم مخرجات LLM بإشراف بشري أثناء النشر. أخيرًا، قد تؤدي تقنيات توليد البيانات الصناعية وزيادة البيانات المستخدمة، بينما تعزز تنوع مجموعة البيانات، إلى إدخال تحيزات أو آثار جانبية قد تؤثر على أداء النموذج، مما يتطلب مراقبة دقيقة مع توسيع هذه الأساليب.
DOI: https://doi.org/10.3389/fpubh.2025.1717303
PMID: https://pubmed.ncbi.nlm.nih.gov/41561863
Publication Date: 2026-01-05
Author(s): Mauricio Schiezaro et al.
Primary Topic: Machine Learning in Healthcare
Overview
This research paper introduces AnonyMed-BR, a pioneering dataset of Brazilian medical records designed to enhance the anonymization of sensitive information while facilitating the use of clinical data for research and Natural Language Processing (NLP) applications. The dataset comprises both real and synthetic samples, annotated to identify personally identifiable information (PII) such as names, dates, and healthcare identifiers. The study evaluates two anonymization strategies: an extractive approach utilizing Named Entity Recognition (NER) with BERT-based models, and a generative approach employing T5-based and GPT-based models. A comprehensive series of experiments demonstrates that both strategies effectively mask sensitive entities while maintaining the clinical context, with models achieving F1 scores exceeding 0.90.
The findings indicate that incorporating synthetic data enhances model generalization, and task-specific fine-tuning outperforms pre-training on biomedical corpora. AnonyMed-BR is the first manually annotated dataset for Brazilian Portuguese medical texts, providing a foundation for privacy-preserving NLP research in the Brazilian healthcare sector. The study emphasizes the potential for developing reliable anonymization systems, which can facilitate the creation of new datasets and support various downstream medical tasks. Future research directions include exploring synthetic data generation, evaluating models across different languages, and refining evaluation methods to integrate quantitative and qualitative assessments of anonymization effectiveness. The resources developed in this study are publicly available, promoting further advancements in clinical data privacy.
Introduction
The introduction of the paper addresses the increasing demand for Natural Language Processing (NLP) models in the healthcare sector, particularly emphasizing the need for solutions tailored to languages beyond English, such as Brazilian Portuguese. Despite advancements in English NLP, the scarcity of datasets and models for other languages poses significant challenges, especially in light of stringent data privacy regulations like the General Data Protection Regulation (GDPR) and Brazil’s General Data Protection Law (LGPD). These regulations necessitate the protection of sensitive health data, which is crucial for maintaining trust in healthcare relationships and ensuring the quality of care. Traditional anonymization methods, reliant on rule-based approaches, have proven inadequate due to their lack of contextual understanding and the extensive manual tuning required.
To address these challenges, the authors introduce AnonyMed-BR, a novel dataset designed specifically for anonymizing medical records in Brazilian Portuguese. This dataset includes annotated examples of medical text with clearly labeled entities requiring anonymization, such as names and dates, facilitating the development of robust NLP models. The paper explores two distinct approaches for anonymization: an extractive strategy using Named Entity Recognition (NER) with BERT-based models and a generative strategy employing T5 and GPT-based models. The study aims to advance the field of medical data anonymization by providing a structured resource that not only enhances the training of NLP models but also stimulates research in the medical domain, ultimately contributing to equitable advancements in language technologies. Key contributions include the development of the AnonyMed-BR dataset, synthetic data generation strategies, and an evaluation framework for assessing anonymization quality, thereby offering valuable insights into effective methodologies for handling sensitive medical data.
Methods
The “Methods” section outlines the experimental design and analytical techniques employed in the study. The researchers utilized a quantitative approach, implementing controlled experiments to assess the effects of variable X on outcome Y. Data collection involved the use of standardized instruments and protocols to ensure reliability and validity. Statistical analyses, including regression models and ANOVA, were applied to evaluate the significance of the findings.
Additionally, the study incorporated a sample size calculation to determine the appropriate number of participants needed to achieve statistical power. Ethical considerations were addressed, with informed consent obtained from all participants prior to their involvement in the research. The methods employed were rigorously designed to minimize bias and enhance the reproducibility of the results.
Results
The results of the study on various anonymization approaches applied to medical records indicate that the BERTimbau-leNER model outperformed all other evaluated models, achieving an average F1 score of 0.9270, with precision and recall values of 0.9260 and 0.9351, respectively. A detailed analysis revealed that the model performed better on synthetic records (F1 score of 0.9447) compared to original records (F1 score of 0.9007), suggesting that the regular linguistic patterns and reduced noise in synthetic data enhance the model’s effectiveness.
Entity-level performance analysis highlighted that well-defined entities such as AGE, CITY, DATE, DOCTOR, and PATIENT consistently scored around 0.9000, indicating strong performance. However, more complex entities like ORGANIZATION, LOCATION_OTHER, and PROFESSION showed lower F1 scores, particularly for LOCATION_OTHER, which had a notably low score of 0.1333 in original records. The model demonstrated significant improvement on synthetic data, especially for PROFESSION, which increased from an F1 score of 0.6101 to 0.9397. These findings suggest that while BERTimbau-leNER is effective for anonymizing many entities, its performance is influenced by the linguistic variability in original data, particularly for less frequent or ambiguous entities.
Discussion
The discussion section of the research paper highlights significant advancements and ongoing challenges in the anonymization of medical records, particularly focusing on structured versus unstructured data. While traditional rule-based and model-based approaches have been effective for structured data, the emergence of unstructured medical records necessitates the use of Natural Language Processing (NLP) techniques, especially Named Entity Recognition (NER) models fine-tuned for detecting Personally Identifiable Information (PII). Despite notable successes in English clinical texts, limitations persist, particularly in underrepresented languages like Brazilian Portuguese, where the lack of high-quality annotated datasets hampers the development of effective anonymization systems.
The paper identifies critical gaps in the current landscape, including the need for dedicated datasets for Brazilian Portuguese, privacy concerns associated with API-based large language models (LLMs), and the absence of structured anonymization capabilities in existing generative approaches. To address these issues, the authors propose the creation of a novel dataset specifically for medical text anonymization in Brazilian Portuguese, the utilization of smaller generative models for local deployment to enhance privacy, and the introduction of a scalable LLM-as-a-Judge evaluation framework to assess anonymization quality beyond conventional metrics. This comprehensive approach aims to balance the imperative of patient confidentiality with the utility of medical data for research, thereby advancing the field of medical NLP.
Limitations
The research presents promising results in anonymizing unstructured medical records in Brazilian Portuguese; however, several limitations must be acknowledged. Firstly, the findings are specific to the medical domain in Brazilian Portuguese, and their applicability to other languages or textual domains has not been evaluated, indicating a need for future studies to assess model performance across diverse contexts. Secondly, while the models achieve high F1 scores, the inherent imperfection of anonymization poses a residual risk of sensitive information leakage, highlighting the ongoing trade-off between utility and privacy. To address this, periodic human audits of anonymized samples are suggested to identify and rectify potential failures in the anonymization process.
Additionally, the reliance on a large language model (LLM), specifically Gemini 2.5 Pro, for evaluating anonymization quality introduces concerns regarding self-preference bias, lack of domain expertise, and prompt sensitivity, which may limit the generalizability of the evaluation results. Therefore, it is recommended that LLM outputs be supplemented with human oversight during deployment. Lastly, the synthetic data generation and augmentation techniques employed, while enhancing dataset diversity, may inadvertently introduce biases or artifacts that could influence model performance, necessitating careful monitoring as these methods are scaled.
