GPT
M

MatrAIx_Persona_1M

קוד פתוח

MatrAIx2026other2026-06-21

  • persona
  • coreset
  • synthetic
  • survey
  • parquet

הדאטהסט מציע כמיליון פרסונות מוגדרות לפי 1,290 מאפיינים קטגוריאליים. הוא מיועד למי שצריך להעריך או לאמן מודלי שפה על מגוון התנהגויות, אך דורש פענוח בינארי ייעודי כדי לגשת לנתונים.

  • 14,663הורדות בחודש
  • 77לייקים

מה זה

המאגר כולל 999,847 רשומות שמחולקות לשני חלקים עיקריים: 599,847 פרסונות שמבוססות על נתונים אמיתיים ו־400,000 פרסונות סינתטיות לחלוטין. מקורות המידע מגוונים וכוללים חילוצי מודל מוויקיפדיה (323,438), סקר המפתחים של סטאק אוברפלו (113,120), ביקורות אמזון (97,915), סקר GSS של NORC (63,532), נתוני יישור של PRISM (1,487), וסקר אנושי ייעודי בהסכמה (355). המאפיינים מיושרים סטטיסטית בארבעה ממדים (גיל, אזור, זהות מגדרית ועירוניות) מול נתוני אוכלוסייה עולמיים של האו"ם והבנק העולמי ל־2024.

מבנה הנתונים דליל מאוד. בממוצע רק 656 מתוך 1,290 המאפיינים מלאים, תלוי במקור. פרסונות סינתטיות מכילות את כל המאפיינים, בעוד שחילוץ מביקורת אמזון מחזיק בממוצע כ־16 מאפיינים בלבד. שדות שלא מולאו במקור נשארו ריקים ללא השלמה מלאכותית, והטקסטים התיאוריים נוצרו באמצעות מודלי שפה ולא הגיעו ישירות מהנבדקים.

מתאים ל

  • הערכת הטיה ואישיות במודלים

    בדיקת התנהגות מודלי שפה מול פרופילים מגוונים לפי 1,290 המאפיינים המוגדרים בסכימה.

  • אימון התאמה אישית לא מסחרי

    כיוונון מודלים מחקריים ליצירת מענה מותאם לפי תכונות דמוגרפיות וסוציו-אקונומיות.

  • מחקר על דחיסת נתונים וסכמות

    בחינת שיטות פענוח בינאריות יעילות לייצוג וקטורי דליל של מאפיינים קטגוריאליים.

איפה זה נופל

הנתונים אינם מדגם מייצג של אוכלוסייה כלשהי. הכיול הסטטיסטי בוצע רק על ממדים בודדים ולא מתקן הטיות בחירה במקורות או את ההתפלגות המשותפת. בנוסף, רוב המידע שמכונה "אנושי" מבוסס על חילוצי מודלים מטקסטים של ויקיפדיה ואמזון, מה שגורר בהכרח שגיאות פענוח והזיות. כל התיאורים הטקסטואליים הם פלט של מודלי שפה. המאגר גם אינו כולל קטינים כלל, מאחר שכל 153 הרשומות של מתחת לגיל 18 הוסרו, ולכן הסך עומד על 999,847 ולא מיליון.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

לא. הרישיון מאפשר שימוש מחקרי בלבד, והמפרסמים אוסרים במפורש על שילוב הדאטהסט או מודלים שנגזרו ממנו במוצרים מסחריים או בשירותים בתשלום.

כמה שוקל הדאטהסט ואיך הוא שמור?

המאגר שוקל 4.17 ג'יגה בייט ומחולק לעשרה קובצי Parquet דחוסים ב־Zstandard. המאפיינים ארוזים ברמת הביטים ודורשים פענוח מול קובץ סכימה ב־pyarrow.

האם יש בדאטהסט נתונים בעברית?

הכרטיס אינו מציין תמיכה בעברית. המקורות המרכזיים מבוססים על פלטפורמות בינלאומיות באנגלית כמו סטאק אוברפלו, סקרי GSS בארה"ב וחילוצים מאמזון וויקיפדיה.

מאיפה הגיעו הנתונים?

כ־60% מהרשומות מבוססות על נתונים אמנושיים ממקורות כמו ויקיפדיה, סטאק אוברפלו, אמזון וסקרים, שחולצו באמצעות מודלי שפה. 40% הנותרים הם פרופילים סינתטיים שיוצרו מאפס.

איך טוענים

אי אפשר להשתמש בספריית datasets הרגילה כדי לקרוא את הקבצים. עשרת קובצי ה־Parquet, ששוקלים יחד 4.17 ג'יגה בייט, שומרים את 1,290 המאפיינים בצורה דחוסה של 4 ביט לערך (645 בייטים לשורה). כדי לגשת למידע אתם צריכים לטעון את הקבצים ישירות עם pyarrow, לקרוא את קובץ הסכימה persona_codes.schema.json, ולפענח את הרשומות מול מפת הביטים של הערכים החסרים (null_bitmap). שדות מפתח שכדאי לשים לב אליהם כוללים את attributes, attribute_overrides, grounding, ו־populated_attribute_count. לחיפושים וסינונים כדאי להשתמש באינדקס postings.sqlite המצורף במקום לסרוק את כל הקבצים.

from datasets import load_dataset

ds = load_dataset("MatrAIx2026/MatrAIx_Persona_1M")

הרישיון

הרישיון מוגדר כ־other והשימוש מוגבל למחקר לא מסחרי בלבד. חל איסור מוחלט לשלב את הדאטהסט, חלקים ממנו, או נגזרות שלו במוצר מסחרי או בשירות בתשלום. הגבלה זו חלה גם על 400,000 הרשומות הסינתטיות ועל מודלים שאומנו עליהן, מאחר שהמקורות המקוריים כמו ויקיפדיה, סטאק אוברפלו ואמזון מחזיקים בתנאי שימוש משלהם. חובה לצטט את המאמר ולקשר לכרטיס הדאטהסט.

הרישיון המלא ב־Hugging Face ↗