GPT
C

common_corpus

קוד פתוח

PleIAsרישיון לא דווח2024-11-12

המאגר מרכז 2.27 טריליון תווכנים של טקסט חופשי מזכויות יוצרים או ברישיונות פתוחים. הוא נבנה עבור מי שחייב לאמן מודלים בלי להסתבך עם תביעות קניין רוחני או דרישות שקיפות של ה־AI Act.

  • 122,772הורדות בחודש
  • 418לייקים

מה זה

המאגר מורכב משישה אוספים מרכזיים שכוללים ספרים, עיתונים היסטוריים, מסמכים ממשלתיים ומשפטיים, מאמרים אקדמיים, קוד מקור ותוכן ויקי. החלק הגדול ביותר מגיע מנכסי תרבות ברשות הציבור כמו פרויקט גוטנברג וויקיטקסט, לצד מסמכים ממוסדות רגולטוריים כמו SEC, פרלמנט האיחוד האירופי ומאגרי פסיקה. שאר המידע נשען על קוד פתוח מגיטהאב, מאמרים מ־OpenAlex, ונתונים סמנטיים מוויקינתונים שתורגמו למשפטים טבעיים.

הסינון כלל מודלים לתיקון שגיאות סריקה אופטית בטקסטים ישנים, הסרת תכנים בעלי ערך לימודי נמוך, ודירוג איכות לקוד מקור שבו הושארו רק שמונים האחוזים העליונים. בנוסף, הופעל מסווג רעילות ייעודי להסרת כינויי גנאי ותכנים פוגעניים, והוסרו פרטי זיהוי אישיים בעיקר בעזרת כלי Presidio ומודל סינון ייעודי לתקנות הגנת המידע האירופיות.

מתאים ל

  • אימון בסיס תואם רגולציה

    אימון מודלי שפה גדולים שעומדים בדרישות השקיפות המחמירות של ה־AI Act האירופי.

  • מחקר היסטורי וסמנטי

    ניתוח בלשני וסמנטי על מאגר ענק של ספרות, עיתונות ומשפט שנוצרו לפני המאה ה־21.

  • אימון מודלי קוד ומדע

    פיתוח מודלים ממוקדים לניתוח מאמרים מדעיים מ־OpenAlex או כתיבת קוד על בסיס גיטהאב.

איפה זה נופל

יותר ממחצית מהתוכן נכתב לפני המאה ה־21, עובדה שיוצרת פער כבד בידע מודרני ושפה עכשווית. המאגר מתרכז בעיקר באנגלית ובצרפתית, ועברית אינה נכללת ברשימת השפות של המאגר. למרות ניקוי הרעילות והסרת פרטי הזיהוי, טקסטים היסטוריים עדיין מכילים הטיות וסטריאוטיפים ישנים, וחלק מהמידע המנהלי הצרפתי הושמט לגמרי מחשש לזיהוי עקיף של אנשים לפי דרישות החוק האירופי.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצרים מסחריים?

כן, לפי כרטיס המאגר כל המידע מותר לשימוש מסחרי ומחקרי ללא צורך בבקשת רשות. יחד עם זאת, הרישיונות משתנים בין מסמך למסמך וכוללים נחלת הכלל לצד רישיונות כמו MIT ו־Creative Commons. אם המוצר דורש תנאים ספציפיים, יש לסנן את הרשומות לפי שדה הרישיון שמופיע בכל מסמך.

האם המאגר כולל טקסטים בעברית?

לא, עברית אינה מופיעה ברשימת השפות של המאגר. רוב הטקסט מרוכז באנגלית ובצרפתית, לצד שפות אירופיות נוספות, לטינית, יוונית, ערבית ומעט שפות נוספות. מי שמחפש לאמן מודל להבנת עברית לא ימצא כאן מענה.

כמה המאגר שוקל ואיך הוא בנוי טכנית?

המאגר מכיל 2.27 טריליון תווכנים שפרוסים על פני 10,020 קבצי parquet שונים. מדובר בנפח עצום שמחייב שימוש בשרתי אחסון כבדים או טעינה מקבילית ומבוזרת. לא מומלץ לנסות להוריד את כולו לתחנת עבודה רגילה.

במה הוא שונה מדאטהסטים אחרים שסורקים את הרשת?

בניגוד לסריקות רשת כלליות שמכילות חומרים מוגנים בזכויות יוצרים, כאן נעשה איסוף ממוקד ממקורות פתוחים מוגדרים. לכל רשומה מוצמד מקור, קישור ישיר וסוג רישיון, כך שרמת התיעוד מאפשרת מעקב מלא אחר מקור הנתונים ברמת המסמך הבודד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset, ללא צורך בהרשאת גישה מיוחדת. המאגר מורכב ממעל עשרת אלפים קבצי parquet המחולקים לתת-תיקיות, כך שלא מורידים הכל למחשב מקומי בלי אחסון ייעודי ומומלץ לעבוד בסטרימינג. רשומות המידע כוללות שדות מפתח כמו טקסט מלא, שפה, כמות מילים ותווכנים, תאריך מקור, קישור למסמך המקורי, והרישיון הספציפי שמוצמד לכל פריט.

from datasets import load_dataset

ds = load_dataset("PleIAs/common_corpus")

הרישיון

בעמוד המאגר הרישיון הכללי מוגדר כלא דווח, אך לפי התיעוד הפנימי כל פריט בנפרד נמצא ברשות הציבור או תחת רישיונות חופשיים כמו Creative Commons, MIT או הרישיון הפתוח הצרפתי. המשמעות היא שאין רישיון אחיד על הכל. מותר לאמן מודלים לשימוש מסחרי ומחקרי, אך חובה לסנן לפי שדה הרישיון בכל רשומה כדי לוודא שאינכם מפרים חובת ייחוס במסמכים שדורשים זאת.

הרישיון המלא ב־Hugging Face ↗