GPT
N

Nemotron-PII

קוד פתוח

nvidiacc-by-4.02025-08-21

  • datadesigner
  • pii
  • privacy
  • data-masking
  • synthetic-data

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאה אלף רשומות סינתטיות לחלוטין באנגלית לזיהוי מידע רגיש ופרטי. הוא נבנה על פרסונות מבוססות מפקד אוכלוסין כדי לאמן מודלים להסרת פרטים מזהים בלי לסכן מידע אמיתי.

  • 3,225הורדות בחודש
  • 112לייקים

מה זה

המאגר כולל 100,000 מסמכים שמחולקים שווה בשווה בין 50,000 לאימון ו־50,000 לבדיקה. הנתונים לא נגרדו מהרשת אלא נוצרו באמצעות NVIDIA NeMo Data Designer, תוך שימוש בפרסונות סינתטיות שחוברו לנתוני מפקד האוכלוסין של ארצות הברית במטרה לשמור על אמינות דמוגרפית ועקביות פנימית בכל מסמך.

הרשומות מכסות יותר מ־50 תעשיות כמו בריאות, פיננסים ואבטחת מידע, ומגיעות גם כטקסט חופשי כמו אימיילים והערות וגם כמסמכים מובנים כמו טפסים וחשבוניות. התיוג נעשה ישירות בזמן היצירה עבור יותר מ־55 קטגוריות שונות של פרטי זיהוי ומידע רפואי, כולל שמות, מספרי ביטוח לאומי, רישומים רפואיים, כתובות וטלפונים.

מתאים ל

  • אימון מסנני פרטיות

    אימון מודלי סיווג טוקנים למחיקת פרטי זיהוי מאימיילים וטפסים ארגוניים.

  • בדיקת עמידה ברגולציה

    מבחן ביצועים לזיהוי מידע רפואי רגיש על 50,000 רשומות המבחן המסומנות מראש.

  • ניקוי נתונים לצ'אטבוטים

    סינון מספרי חשבון וטלפון מטקסטים פנימיים לפני הכנסתם למאגר ידע באנגלית.

איפה זה נופל

המאגר כתוב כולו באנגלית, כך שהוא לא יעזור ישירות למי שצריך לסנן שמות, מספרי זהות או כתובות בעברית. בנוסף, כל הנתונים סינתטיים. למרות שהם עוגנו בנתוני מפקד אוכלוסין כדי לייצר מגוון אנושי, מודלים של שפה שיוצרים טקסט עלולים לפספס שגיאות כתיב אמיתיות, קיצורים מוזרים וסגנון כתיבה עילג של משתמשים חיים. החלוקה הגאוגרפית אמנם מסמנת מסמכים בינלאומיים, אך כ־12 אחוזים מהם עדיין חופפים לפורמטים אמריקאיים. כדאי לבדוק ביצועים על מידע אנושי אמיתי לפני שמשלבים את המודל בייצור.

שאלות
נפוצות

האם מותר להשתמש בו לאימון מודל מסחרי?

כן. הרישיון הוא Creative Commons Attribution 4.0, והיוצרים מציינים במפורש שהדאטהסט מיועד לשימוש מסחרי. כל מה שנדרש זה לתת ייחוס מתאים.

האם הדאטהסט כולל טקסטים בעברית?

לא. כל 100,000 הרשומות כתובות באנגלית בלבד. חלק מהמסמכים מתויגים כבינלאומיים, אבל השפה והמבנים עדיין מותאמים לעולם דובר האנגלית.

איך נוצרו התוויות והאם יש בהן מידע של אנשים אמיתיים?

הכל נוצר באמצעות מודלים ומערכת NeMo Data Designer של אנבידיה. הנתונים מבוססים על פרסונות סטטיסטיות ממפקד האוכלוסין של ארצות הברית, והתיוג הופק אוטומטית בזמן יצירת הטקסט, כך שאין כאן מידע פרטי אמיתי שנחשף.

איך המידע מסודר מבחינת חלוקת הקבצים?

הנתונים מחולקים שווה בשווה לשני קובצי Parquet, אחד של 50,000 רשומות לאימון ואחד של 50,000 רשומות לבדיקה. שניהם מכילים שילוב של מסמכים בתבניות אמריקאיות ובינלאומיות.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך בבקשת גישה מיוחדת, ומאוחסן בקובצי Parquet שכוללים קובץ אימון וקובץ בדיקה. כל שורה מכילה מזהה ייחודי, תחום, סוג מסמך, תיאור, ציון אם הטקסט מובנה או לא, ואת הגדרת האזור הגאוגרפי. השדות הקריטיים לעבודה הם text שמכיל את הטקסט הגולמי, spans שמספק רשימת מרווחי תווים עם התוויות לכל ישות, ו־text_tagged שמציג את הישויות מתויגות ישירות בתוך הטקסט.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-PII")

הרישיון

הרישיון הוא CC BY 4.0, שמתיר שימוש מסחרי, שינוי והפצה, ומתאים גם לאימון מודלים מסחריים. התנאי היחיד הוא מתן קרדיט מתאים למחברים ולחברת אנבידיה. אין דרישה לפתוח את המודל שלכם באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗