GPT
F

finepdfs-edu

קוד פתוח

HuggingFaceFWodc-by2025-11-11

מעל 350 מיליארד טוקנים של תוכן לימודי מסונן שנשלף מקובצי PDF ברשת. מתאים למי שמאמן מודלי שפה וצריך טקסט צפוף בידע ולא עוד זבל מאתרי חדשות.

  • 12,260הורדות בחודש
  • 97לייקים

מה זה

המאגר מכיל קובצי PDF שחולצו מסריקות CommonCrawl בין השנים 2013 ל־2025. הצוות לקח את מאגר המקור FinePDFs, דירג כ־300 אלף דוגמאות בעזרת המודל Qwen3-235B-A22B-Instruct-2507 בסולם של אפס עד חמש, ואימן מסווגים ייעודיים לכל שפה. עבור אנגלית אימנו את ModernBERT-large ועבור שאר השפות את mmBERT-base.

התוכן ברשת כולל מעט מאוד חומר אקדמי טהור, ואם היו חותכים בציון שלוש בלבד, רק שני אחוז מהדאטה היה שורד. במקום זה סיננו החוצה תשעים אחוז מהחומר ולקחו את העשירון העליון בכל שפה. המסמכים עברו ניקוי כפילויות גלובלי, והטקסט חולק ל־69 שפות שונות שיושבות בתיקיות נפרדות לפי קוד שפה וכתב.

מתאים ל

  • קדם אימון מודלי שפה

    הזנת טקסט לימודי איכותי ומנופה לצורך שיפור ביצועים במבחני ידע כללי כמו MMLU ו־ARC.

  • אימון מסווגי איכות

    שימוש בטקסטים ששרדו את הסינון לבניית מודלים שמזהים תוכן חינוכי בשפות זרות.

  • הרחבת אוצר מילים מקצועי

    אימון טוקנייזרים ומודלים רב-לשוניים על מסמכים עשירים במינוחים מקצועיים מתחומי ידע מגוונים.

איפה זה נופל

יש פה בעיה ניכרת של ערבוב שפות בתוך אותם מסמכים, והצוות ממליץ להריץ סינון ייעודי אם זה מפריע לכם. בנוסף, הציון הלימודי נשען על 2,048 הטוקנים הראשונים והאחרונים בלבד במסמכים ארוכים, מה שעלול לפספס תוכן באמצע. עברית אינה מופיעה ברשימת השפות המרכזיות שסומנו במאגר, כך שלאימון מודל מקומי הוא כמעט חסר תועלת.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי?

כן, רישיון ODC-By מאפשר שימוש מסחרי ללא תשלום. החובה היחידה היא מתן קרדיט ליוצרי הדאטהסט. יש לקחת בחשבון גם את תנאי השימוש של CommonCrawl שמהם נאספו הקבצים.

האם יש במאגר טקסטים בעברית?

המאגר מציג 69 שפות אך עברית אינה ברשימת השפות הראשית שצוינה בכרטיס. אם קיימים מסמכים בודדים בעברית הם מעטים מאוד ולא זכו למסווג ייעודי.

במה הוא שונה מ־FineWeb-Edu?

המאגר מתמקד בקובצי PDF בלבד ולא בדפי אינטרנט כלליים, ועבר ניקוי כפילויות גלובלי. בנוסף, הציון נקבע על ידי מורה מסוג Qwen3 והסינון הוגדר לפי עשרת האחוזים העליונים בכל שפה.

כמה שוקל הדאטהסט ואיך מתמודדים עם הגודל?

המאגר כולל מעל 350 מיליארד טוקנים במאות קובצי parquet. לא מורידים הכל בבת אחת, אלא משתמשים בטעינה רציפה בהזרמה או מורידים רק את התיקייה של השפה הספציפית שנחוצה לכם.

איך טוענים

טוענים את המידע ישירות בספריית datasets עם ציון תת המאגר הרצוי, למשל hrv_Latn לקרואטית, או מורידים קובצי parquet ישירות מה־Hub בעזרת huggingface_hub. אין צורך לבקש אישור גישה מראש. בגלל הגודל העצום כדאי לעבוד עם streaming מופעל או להגביל הורדה של שפות בודדות שמעניינות אתכם באמצעות allow_patterns.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/finepdfs-edu")

הרישיון

רישיון ODC-By 1.0 מתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים קרדיט מלא למחברים. אין דרישה לשתף את המודל המאומן או את הנגזרות תחת אותו רישיון. בנוסף, חלים על המאגר תנאי השימוש של CommonCrawl.

הרישיון המלא ב־Hugging Face ↗