GPT
P

propella-annotations

קוד פתוח

openeurollmcc-by-4.02026-01-12

  • propella
  • data
  • annotation
  • filtering
  • curation

המאגר מרכז תיוגים מוכנים למיליארדי מסמכים ממאגרי אימון מובילים כדי לאפשר סינון איכותי בקנה מידה עצום. מי שמאמן מודלים ירצה אותו כדי לחסוך אלפי שעות חישוב של תיוג ומיון טקסטים.

  • 9,442הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל תיוגים מכונה בלבד, שהופקו באמצעות המודל propella-1-4b. כל רשומה כוללת מזהה מסמך לצד 18 מאפיינים שונים המחולקים לשש קטגוריות, ביניהן איכות הטקסט, צפיפות המידע, רמת הקהל, בטיחות, זיהוי פרטי מידע אישיים והקשר גיאוגרפי.

הנתונים מקוטלגים לפי מקורות האימון המקוריים שמהם נלקחו הטקסטים. בין המאגרים המתויגים נמצאים FineWeb-2, FinePDFs, HPLT 3.0, Nemotron-CC, וכן סטים של כוונון עדין דוגמת Dolci, smoltalk2 ו־Nemotron Post Training.

התיוגים חולקו לפי שפות ופיצולים של המאגרים המקוריים. בחלק מהמקרים, כמו ClimbMix או Common Pile, המזהה ברשומה נוצר מגיבוב SHA256 של הטקסט עצמו ולא ממזהה מובנה קיים.

מתאים ל

  • סינון דאטה לאימון מקדים

    סינון מיליארדי מסמכים מ־FineWeb-2 או FinePDFs לפי ערכי איכות וערך חינוכי גבוהים.

  • ניקוי מידע רגיש ואישי

    שליפת מזהי מסמכים שסומנו כבעלי PII או תוכן לא בטוח והסרתם מסט האימון הסופי.

  • איזון נתוני כוונון

    מיון נתוני SFT ו־DPO בערכות כמו Dolci לפי רמת קהל ומורכבות טכנית.

איפה זה נופל

כל התיוגים מגיעים ממודל שפה קטן יחסית של 1.4 מיליארד פרמטרים, מה שמכניס הטיות וטעויות שיפוט מובנות בהערכת האיכות והבטיחות. המאגר עדיין מוגדר כעבודה בתהליך, ויש פערים גדולים בכיסוי: שפות אירופיות מסוימות מיוצגות במאות מיליוני רשומות, בעוד שפות אחרות חסרות לגמרי, ועברית אינה מופיעה ברשימת השפות של הפרויקט. אם אתם בונים מודל שמסתמך על תיוגי בטיחות או סינון PII, אי אפשר להסתמך עליהם בעיניים עצומות.

שאלות
נפוצות

האם המאגר כולל את הטקסט המלא של המסמכים?

לא, המאגר מספק אך ורק את התיוגים ואת מזהה המסמך התואם. כדי לקרוא את הטקסט עצמו יש לטעון את מאגר המקור המקורי, ולהצליב את הנתונים לפי שדה ה־id.

האם מותר להשתמש בזה לפרויקטים מסחריים?

כן, תיוגי המאגר שוחררו תחת רישיון CC-BY-4.0 שמתיר שימוש מסחרי מלא כנגד מתן קרדיט. עם זאת, יש לבדוק בנפרד את הרישיון של מאגרי הטקסט המקוריים שמהם מושכים את התוכן.

האם המאגר כולל תיוגים לטקסטים בעברית?

לא, עברית אינה נכללת ברשימת השפות של המאגר. הדגש כאן הוא על שפות אירופיות גדולות כמו גרמנית, צרפתית, ספרדית ואנגלית, לצד מספר שפות אירופיות נוספות.

איך מפיקים תועלת מהמאגר אם מדובר במיליארדי שורות?

עובדים במצב streaming ישירות דרך הספרייה של Hugging Face. מסננים את מזהי המסמכים הרצויים מקובצי ה־parquet של התיוגים, ורק אז מושכים את הטקסטים המתאימים ממאגר המקור.

איך טוענים

טוענים את התיוגים בספריית datasets של Hugging Face תוך ציון שם תת המאגר והפיצול הרצוי, כמו fineweb-2 עם split של deu_Latn. המאגר מורכב מקובצי parquet המחולקים למאות חלקים. אין צורך לבקש אישור גישה. חשוב לזכור שהקבצים מכילים רק את התיוגים ואת המזהים, כך שכדי להגיע לטקסט עצמו חייבים לטעון את מאגר המקור במקביל, רצוי במצב streaming, ולהצליב ביניהם לפי שדה ה־id.

from datasets import load_dataset

ds = load_dataset("openeurollm/propella-annotations")

הרישיון

התיוגים מופצים תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שנותנים קרדיט מתאים ליוצרים. השימוש בתיוגים אלה לא מחייב אתכם לשחרר את המודל המאומן באותו רישיון, אך עליכם לוודא שהרישיון של מאגר הטקסט המקורי שאתם מושכים בפועל מתיר גם הוא את השימוש המבוקש.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗