GPT
F

finepdfs

קוד פתוח

HuggingFaceFWodc-by2025-09-05

מעל טריליון רשומות טקסט שחולצו מקובצי PDF במאות שפות וסוגי כתב שונים. זהו מאגר עתק שמיועד למי שבונה מודלי שפה וצריך כיסוי רחב במיוחד של שפות נדירות.

  • 51,445הורדות בחודש
  • 928לייקים

מה זה

המאגר כולל טקסטים שחולצו מקובצי מסמכים, ומסווג תחת משימות של יצירת טקסט. הרשומות מחולקות לתצורות שונות לפי שילוב של קוד שפה ושיטת כתב, כמו לטינית, ערבית, קירילית ודוונגארי. סך הכל מדובר ביותר מטריליון רשומות, מה שהופך אותו לאחד ממאגרי הטקסט הגדולים ביותר שפורסמו ברשת.

בפנים יש חלוקה מובנית לקובצי אימון ולחלק מהשפות גם סטים של מבחן. הקבצים עצמם נשמרים בפורמט פרקט ומסודרים בתיקיות ייעודיות לכל ניב ואלפבית. כרטיס המאגר לא מפרט מה מקור המסמכים המקוריים, כיצד בוצע תהליך החילוץ והניקוי מתוך ה־PDF, או אם הופעלו מסנני איכות וסינון רעשים על הטקסטים הגולמיים.

מתאים ל

  • אימון מקדים רב לשוני

    הרחבת אוצר המילים ושיפור ביצועי מודלי שפה בשפות נדירות או מקומיות שלא מקבלות כיסוי ברשת.

  • בניית מודלי ייצור טקסט

    אימון מודלים גנרטיביים על סגנונות כתיבה רשמיים ומסמכים מגוונים שמגיעים במקור מתבניות PDF.

  • מחקר בלשני וסיווג

    ניתוח התפלגות תווים וניתוח תחבירי במאות שיטות כתב ואלפביתים שונים מתוך טקסט גולמי.

איפה זה נופל

הכרטיס לא מדווח על תהליך הסינון, כך שלא ידוע מה טיב הטקסט שחולץ והאם הוא מכיל עיוותים מפענוח PDF, רעשי עימוד, כותרות חוזרות או תוכן משוכפל. חילוץ ממסמכים נוטה להכניס שגיאות מבניות, ואין שום פירוט על בדיקות איכות שנעשו. בנוסף, חסר מידע לגבי גיל המסמכים והמקורות שלהם ברשת, עברית מופיעה ברשימת השפות אבל ללא תיעוד על נפחה או איכותה, וחובה לבדוק מדגמים באופן ידני לפני אימון.

שאלות
נפוצות

האם המאגר כולל עברית?

כן, קוד השפה העברית מופיע ברשימת השפות של המאגר. יחד עם זאת, אין תיעוד בכרטיס שמפרט כמה טקסט יש בעברית ואיך הוא מחולק, ולכן תצטרכו לבדוק את הקבצים בפועל כדי לראות את הנפח והרלוונטיות שלהם.

האם מותר להשתמש בו לאימון מודל מסחרי?

הרישיון הוא odc-by, מה שאומר שמותר להשתמש בו לצרכים מסחריים ולאמן עליו מודלים חופשי. התנאי ההכרחי היחיד הוא מתן ייחוס וקרדיט ברור למפרסמים לפי דרישות הרישיון.

כמה המאגר שוקל בפועל?

המשקל המדויק בגיגה-בייטים לא צוין בכרטיס, אך יש בו מעל 3,500 קבצים ולמעלה מטריליון רשומות. מדובר בנפח חריג בגודלו שלא מומלץ להוריד בשלמותו, אלא לטעון רק את התצורות שאתם צריכים ישירות בקוד.

מאיפה נאספו המסמכים ואיך הם עובדו?

כרטיס המאגר לא מספק מידע על מקור קובצי ה־PDF, על תאריכי האיסוף, או על הכלים ששימשו להמרת המסמכים לטקסט. המידע היחיד שגלוי הוא החלוקה לפי שפות ושיטות כתב שנשמרו בקובצי פרקט.

איך טוענים

טוענים את המידע ישירות בעזרת ספריית הדאטהסטס של האגינג פייס, כאשר מומלץ מאוד לציין את הקונפיגורציה הספציפית לשפה שאתם צריכים, למשל שם השפה ושיטת הכתב. אין צורך בבקשת אישור גישה, המאגר פתוח להורדה מיידית.

הנתונים שמורים בקובצי פרקט ומחולקים לאלפי קבצים שונים. בגלל שמדובר בסדר גודל של מעל טריליון רשומות ואלפי קבצים במאגר כולו, אי אפשר פשוט להוריד הכל למחשב מקומי בלי תשתית אחסון מתאימה, וכדאי לעבוד בהזרמה או לפלטר רק תצורות נבחרות.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/finepdfs")

הרישיון

המאגר מופץ תחת רישיון פתוח מסוג odc-by. הרישיון מאפשר שימוש חופשי, כולל שימוש מסחרי ואימון מודלים, תחת דרישה אחת מרכזית והיא מתן קרדיט וייחוס מתאים למפרסמי המאגר. אין כאן דרישת שיתוף תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗