GPT
N

Nemotron-Personas-France

קוד פתוח

nvidiacc-by-4.02026-03-14

  • synthetic
  • personas
  • NVIDIA
  • French
  • datadesigner

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שישה מיליון פרסונות סינתטיות בצרפתית שמבוססות על נתוני מפקד אוכלוסין אמיתיים. המאגר נותן חלופה מגוונת ודמוגרפית לאימון מודלים בלי לקרוס לתבניות שפה אחידות.

  • 778הורדות בחודש
  • 88לייקים

מה זה

המאגר כולל מיליון רשומות המכילות יחד 6 מיליון פרסונות בצרפתית, עם היקף כולל של 1.5 מיליארד טוקנים. בכל רשומה יש 22 שדות: מזהה ייחודי, 15 שדות הקשר סטטיסטיים ושישה שדות פרסונה שמתארים רקע תרבותי, תחומי עניין, מיומנויות ושאיפות בטקסט חופשי. הפרופילים מחולקים לתחומי עיסוק שונים כמו מקצועות, ספורט, אמנות, קולינריה ומסעות.

הבסיס הסטטיסטי נשען על נתוני מפקד האוכלוסין של צרפת לשנת 2025 מבית INSEE, לצד מאגרי שמות היסטוריים מצרפת ונתוני הגירה ורישום עסקי. NVIDIA וחברת Pleias יצרו את הנתונים באמצעות מערכת NeMo Data Designer, המשלבת מודל גרפי הסתברותי ומודל שפה מסוג Nemotron 3 Super. תהליך הסינון נעשה בעזרת ולידטורים אוטומטיים מובנים שנועדו לשמור על ייצוג מציאותי לפי גיל, מחוז, השכלה ומצב משפחתי.

מתאים ל

  • סינתוז שיחות מגוונות

    יצירת פרומפטים ודיאלוגים מרובי תורות על בסיס רקע תרבותי, תחומי עניין ורמות השכלה שונות.

  • הפחתת הטיות במודלי שפה

    אימון ובדיקה של מודלים מול התפלגות דמוגרפית מציאותית של גילאים ומקצועות במרחב הצרפתי.

  • פיתוח יישומי שיחה מקומיים

    התאמת עוזרי בינה מלאכותית להקשר תרבותי וגיאוגרפי מדויק עבור משתמשים דוברי צרפתית.

איפה זה נופל

המאגר מכיל אך ורק מבוגרים מגיל 18 ומעלה, כך שאין בו שום ייצוג לילדים או בני נוער. כל הטקסטים נכתבו בצרפתית בלבד, ואין כאן נתונים רב-לשוניים או עברית. שמות פרטיים ושמות משפחה לא מופיעים כשדות נפרדים בטבלה, אלא רק נטמעו בתוך תיאורי הפרסונות. בנוסף, חסרות פרסונות מעולמות תאגידיים כבדים כמו פיננסים ובריאות, והנתונים עצמם סינתטיים לחלוטין ולכן עלולים להכיל הטיות שמקורן במודל השפה שיצר אותם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא CC BY 4.0 והכרטיס מציין במפורש שהמאגר מוכן לשימוש מסחרי. אתם יכולים לאמן עליו מודלים לכל מטרה, בתנאי שתתנו ייחוס מתאים ל־NVIDIA ול־Pleias.

האם יש במאגר תמיכה בעברית?

לא. כל הנתונים, שדות הפרסונה והטקסטים נוצרו בצרפתית בלבד. המאגר מיועד ספציפית לפיתוח מערכות בהקשר הצרפתי.

האם הדאטהסט כולל שמות מלאים של אנשים אמיתיים?

לא, כל הנתונים נוצרו באופן סינתטי ואינם שייכים לאנשים אמיתיים. בנוסף, שמות פרטיים ושמות משפחה לא מופיעים כשדות נפרדים במאגר אלא שולבו בתוך הטקסט של הפרסונות.

איך הנתונים נאספו ונבנו?

היוצרים שילבו נתונים סטטיסטיים ממפקד האוכלוסין הצרפתי של 2025 ומאגרי שמות עם מערכת NeMo Data Designer. מודל גרפי הסתברותי ומודל שפה NVFP4 ייצרו את הפרופילים לפי ההתפלגויות הסטטיסטיות.

איך טוענים

הנתונים מחולקים ל־12 קבצי Parquet תחת התיקייה data, לצד קובץ תיעוד וקבצי תמונות, בסך הכל 25 קבצים במאגר. אין צורך באישור גישה מוקדם או במילוי טופס, אפשר למשוך אותם ישירות באמצעות ספריית datasets של Hugging Face. כדאי להתמקד בשדות ההקשר הדמוגרפיים כדי לסנן תתי אוכלוסיות לפי מחוזות או גילאים, ובשדות הפרסונה שמכילים את הטקסט המילולי עבור יצירת נתוני אימון לשיחה.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-France")

הרישיון

המאגר מופץ תחת רישיון Creative Commons Attribution 4.0. הרישיון מתיר שימוש מסחרי מלא, כולל אימון מודלים, יצירת נגזרות והפצה. הדרישה היחידה היא מתן קרדיט מתאים ליוצרים המקוריים, NVIDIA ו־Pleias. אין חובה לשתף מודלים שאומנו עליו תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗