GPT
H

HPLT2.0_cleaned

קוד פתוח

HPLTcc0-1.02024-10-19

אוסף ענק של מסמכי רשת מסוננים ב־191 שפות שנועד לאימון מודלי שפה. המקור העיקרי הוא סריקות של ארכיון האינטרנט, מה שמספק גיוון אמיתי לעומת מאגרים שמבוססים רק על קומון קרול.

  • 132,135הורדות בחודש
  • 45לייקים

מה זה

המאגר כולל מסמכים שנאספו מסריקות רשת רחבות היקף, בעיקר מתוך ארכיון האינטרנט ובתוספת נתונים מקומון קרול. הרשומות עברו סינון וניקוי מקיפים, כולל חלוקה לפי שפות ואלפביתים שונים. הגרסה הנוכחית היא המהדורה הנקייה, שמכילה טקסטים מחולקים למקטעים ומילים שנמדדו בפועל בכל אחת מ־191 השפות הנתמכות בפרויקט.

התוכן מאורגן בתיקיות ייעודיות לכל שפה וכתב, למשל ערבית באלפבית ערבי או אפריקאנס באלפבית לטיני. הקבצים נשמרים בפורמט פארקט שהומר אוטומטית למחצה לקראת ההעלאה. החלוקה הזו נועדה לאפשר גישה ממוקדת לחלקי שפה בודדים בלי לחייב משיכה של כל המאגר בבת אחת.

מתאים ל

  • אימון מקדים למודלי שפה

    בסיס טקסטואלי רחב למודלים מרובי שפות שזקוקים למקורות מעבר לקומון קרול הרגיל.

  • בניית מודלים ממוקדי שפה

    שליפת תת קבוצה של שפה בודדת כמו נורווגית או ערבית לאימון ייעודי וזול.

  • הערכת ביצועי מודלים

    מבחני מילוי מסכות ויצירת טקסט על שפות מגוונות במחקרים בלשניים וממוחשבים.

איפה זה נופל

היוצרים עצמם ממליצים לעבור לגרסה שלוש, אלא אם יש לכם צורך מוגדר בגרסה זו. הביצועים במנדרינית נמוכים משמעותית ביחס לחלופות כמו פיינווב שתיים. המאגר מבוסס על סריקת דפי רשת ולכן כולל את כל הרעש הטיפוסי של אתרים פומביים, למרות הניקוי שעבר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא נחלת הכלל ללא שום הגבלה. אתם יכולים לאמן עליו מודלים, לשלב אותם במוצר מסחרי ולמכור גישה אליהם בלי לשלם תמלוגים או לבקש רשות מאף אחד.

מה ההבדל בין המאגר הזה לבין פיינווב?

רוב המידע כאן מגיע מארכיון האינטרנט ולא מקומון קרול, מה שמביא טקסטים שלא קיימים במאגרים הנפוצים. בשפות כמו ערבית, הינדית, רוסית, תאילנדית וטורקית, הביצועים שלו זהים או עדיפים על פיינווב שתיים, אך בסינית הוא חלש יותר.

כמה שטח אחסון צריך בשבילו?

המאגר מכיל קרוב למאה אלף קבצים והיקף של למעלה מטריליון רשומות. גרסת הפארקט שמוצגת כאן שוקלת בערך פי ארבעה מגרסת קובצי המקור שנמצאת באתר הפרויקט, לכן מומלץ למשוך רק את השפות שמעניינות אתכם.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס בקוד פייתון לפי תת קבוצה של שפה ספציפית. הקבצים שמורים בפורמט פארקט וכוללים קרוב למאה אלף קבצים בסך הכל. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין. קחו בחשבון שגרסת הפארקט באתר תופסת בערך פי ארבעה יותר מקום בדיסק בהשוואה לקובצי המקור בפורמט ג'ייסונל שנמצאים באתר הפרויקט.

from datasets import load_dataset

ds = load_dataset("HPLT/HPLT2.0_cleaned")

הרישיון

המאגר שוחרר ברישיון נחלת הכלל, מה שנותן חופש מוחלט. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, להפיץ אותו מחדש, ואין שום חובה לתת קרדיט או לשתף תוצרים באותו רישיון. מודלים שתאמנו על הטקסטים האלה חופשיים מכל מגבלה חוקית שנובעת מרישיון הדאטהסט.

הרישיון המלא ב־Hugging Face ↗