GPT
D

DocHPLT

קוד פתוח

HPLTcc0-1.02025-07-09

מאגר ענק של מסמכים מקבילים בעשרות שפות מול אנגלית. מי שמאמן מודלי תרגום ברמת מסמך מקבל כאן יישור משפטים מלא לצד ציוני איכות וסינון אוטומטיים.

  • 9,726הורדות בחודש
  • 20לייקים

מה זה

המאגר מציע טקסטים מקבילים ברמת מסמך שלם, המחולקים לפי צמדי שפות שמצוותים תמיד מול אנגלית. כל רשומה כוללת מזהי מסמכים, את הטקסט המלא מפורק למשפטים בשפת המקור ובשפת היעד, ומבנה יישור שממפה בין המשפטים המקבילים. החלוקה הפנימית בנויה לפי קונפיגורציות של צמדי שפות, וכוללת פיצול אימון בלבד.

איסוף המידע והעיבוד שלו נשענים על סינון אוטומטי. לצד כל יישור מופיעים ציונים ייעודיים מכלי סינון כמו bicleaner, bifixer ומדד התאמה של המיישר. הנתונים האלה מאפשרים לסנן החוצה תרגומים רועשים או משפטים שלא הותאמו כהלכה לפני שמזינים אותם לתהליך האימון.

מתאים ל

  • אימון מודלי תרגום

    לימוד מודלים לתרגום ברמת המסמך תוך שימוש בהקשר רחב בין משפטים עוקבים.

  • סינון מקבילי לפי איכות

    חיתוך זוגות משפטים לפי ציוני bicleaner לבניית קורפוס תרגום נקי.

  • מחקר יישור טקסטים

    הערכה ופיתוח של כלים אוטומטיים להתאמת פסקאות ומשפטים בין שפות.

איפה זה נופל

הנתונים מגיעים מסריקה ויישור אוטומטיים, ולכן תמיד קיים חשש לשגיאות התאמה, משפטים שנקטעו ותרגום מכונה מוסווה שנכנס למקורות. אין במאגר חלוקה מובנית לערכות בדיקה והערכה, אלא רק נתוני אימון. בנוסף, חסר פירוט בכרטיס לגבי מועד איסוף הטקסטים ומקורות הרשת המדויקים, מה שמחייב בדיקה מדגמית של איכות התרגום וניקוי רעשים לפני שמשלבים את המידע באימון מודל לייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, המאגר פורסם ברישיון חופשי לחלוטין מסוג CC0. הרישיון מאפשר שימוש מסחרי מלא, שינוי של המידע והטמעה במוצרים סגורים. אין גם שום חובה חוקית לתת קרדיט למפרסמים, אם כי מקובל לציין את המקור בעבודה אקדמית.

האם המאגר כולל נתונים בעברית?

כן, קיימת קונפיגורציה ייעודית לצמד עברית ואנגלית בשם en-he. החלק הזה מכיל מעל ארבעה מיליון רשומות ומיועד לאימון. נפח ההורדה של החלק העברי בלבד עומד על כ־17.4 גיגה-בייט.

כמה שוקל כל המאגר והאם חובה להוריד את כולו?

המאגר כולו עצום ומכיל אלפי קבצים שמגיעים למאות גיגה-בייט במצטבר. אין שום צורך להוריד את כולו אם אתם עובדים על צמד שפות מסוים. טוענים רק את הקונפיגורציה הספציפית שמעניינת אתכם בעזרת הגדרת השם המתאים בספריית הטעינה.

איך סוננו הנתונים והאם הם נקיים מרעש?

הנתונים עברו תהליכי יישור וסינון אוטומטיים שהניבו ציוני התאמה שונים שנשמרו לצד כל משפט. למרות הסינון הממוחשב, עדיין מדובר בטקסטים שנאספו מהרשת ועלולים לכלול שגיאות תרגום או פערי הקשר. מומלץ לסנן את הדגימות בעזרת מדדי האיכות המצורפים לפני תחילת האימון.

איך טוענים

המאגר פתוח לגישה ישירה בפורמט Parquet, ללא צורך בהרשאות מיוחדות או אישור ידני. הוא מפוצל לאלפי קבצים לפי צמדי שפות, ולכן מומלץ לטעון רק את הקונפיגורציה הרצויה, למשל השילוב של עברית ואנגלית, כדי לחסוך זמן ורוחב פס. בעבודה עם הנתונים חשוב לגשת למבנה היישור ולבדוק את שדות הציונים של הסינון כדי להחליט על סף איכות מתאים לחיתוך הדגימות.

from datasets import load_dataset

ds = load_dataset("HPLT/DocHPLT")

הרישיון

המאגר מפורסם תחת רישיון CC0 1.0, שמשמעותו ויתור מלא על זכויות יוצרים והעברה לרשות הציבור. אפשר להשתמש בנתונים לכל מטרה, כולל שימוש מסחרי, שינוי והפצה, בלי חובת ייחוס או דרישה לשתף תוצרים ברישיון זהה. מודל שאומן על המאגר אינו כפוף למגבלות רישוי מצד יוצרי הדאטהסט.

הרישיון המלא ב־Hugging Face ↗