GPT
F

fineweb-tokenized

קוד פתוח

anisoleaiodc-by2026-05-26

  • tabular
  • text
  • pre-training

גרסה שעברה טוקניזציה מראש של מאגר FineWeb, שמיועדת לחסוך עומסי מעבד וצווארי בקבוק באימון מודלים. הנתונים ארוזים כמספרי טוקנים מוכנים להזרמה ישירה לתוך שרשרת האימון.

  • 60,216הורדות בחודש
  • 32לייקים

מה זה

המאגר מכיל טקסט רשת שמקורו בדאטהסט FineWeb המקורי של Hugging Face, אך במקום טקסט גולמי הוא מציע מזהי טוקנים מוכנים. המפרסמים השתמשו בטוקנייזר מסוג BPE של AnisoleAI עם גודל מילון של 52,022 מונחים, והמירו את הנתונים ישירות למערכי מספרים.

המבנה הפנימי מאורגן בקובצי Parquet דחוסים לפי תיקיות של עובדי עיבוד שונים. כל קובץ כזה מכיל עמודה אחת בלבד בשם token_ids ללא ריפוד, שבה כל המסמכים משורשרים ברצף ומופרדים באמצעות תו מיוחד שמסמן סוף מסמך ומזההו 52002.

נכון לפרסום, הפרויקט נמצא בעבודה ומציע כארבעה טריליון טוקנים מתוך יעד כולל של כחמישה עשר טריליון טוקנים שנמצאים במאגר המקור.

מתאים ל

  • אימון מקדים של מודלי שפה

    הזרמת טוקנים ישירה למעבדים גרפיים ללא צורך בהפעלת שלב טוקניזציה מקומי בזמן הריצה.

  • מבחני ביצועים למעבדים

    מדידת קצב הזנת נתונים לחומרה באימון מודלים בקנה מידה גדול עם קובצי נתונים דחוסים.

  • בדיקת ארכיטקטורות קטנות

    טעינת חלקים בודדים של שני מיליארד טוקנים לבדיקת מודלים מהירה בלי להוריד עשרות טראבייט של טקסט.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על סריקות רשת, כך שאין כאן מענה לשפות אחרות או לתוכן בעברית. החיסרון המרכזי הוא הנעילה לטוקנייזר הספציפי של AnisoleAI, מה שאומר שאם ארכיטקטורת המודל שלכם דורשת מילון אחר, אי אפשר להשתמש במאגר הזה. בנוסף, מדובר במזהי מספרים בלבד ולא בטקסט קריא, מה שמקשה מאוד על בדיקה מדגמית של איכות התוכן או סינון הטיות ורעלים לפני שלב האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר הזה לאימון מודל מסחרי?

כן, רישיון odc-by מתיר שימוש מסחרי בנתונים. התנאי המרכזי הוא מתן ייחוס מתאים לפרויקט FineWeb ולמפרסמי העיבוד הנוכחי לפי דרישות הציטוט שמופיעות בתיעוד.

האם יש במאגר טקסט בעברית?

לא, המאגר מסווג ומוגדר לשפה האנגלית בלבד. אם המטרה היא לאמן מודל שיבין עברית, הנתונים האלה לא יספקו מענה.

כמה שוקל המאגר ואיך מתמודדים עם הגודל שלו?

כל קובץ דחוס שוקל כ 2.5 ג'יגה בייט ומכיל כ 2 מיליארד טוקנים, כאשר במאגר יש אלפי קבצים. במקום להוריד הכל מראש, מזרימים קובץ בודד בכל פעם ישירות למערך בזיכרון.

מה ההבדל בין המאגר הזה לבין FineWeb המקורי?

המאגר המקורי כולל מסמכי טקסט גולמיים שמחייבים ניקוי וטוקניזציה שצורכים משאבי מעבד כבדים. כאן הטקסט כבר הומר למספרים שלמים באמצעות טוקנייזר מסוים, מה שחוסך זמן עיבוד אך כובל אתכם למילון הספציפי שלו.

איך טוענים

טוענים את הקבצים ישירות באמצעות PyArrow לקריאת מערכי המספרים השלמים, או בעזרת ספריית datasets הרגילה. המאגר ציבורי ואינו דורש אישור גישה מראש. כל קובץ בודד מכיל בערך שני מיליארד טוקנים ושוקל סביב 2.5 ג'יגה בייט דחוס או כארבעה ג'יגה בייט במצב פתוח, כך שמומלץ להזרים קובץ אחרי קובץ ולא לנסות למשוך את כל 2,499 הקבצים בבת אחת לזיכרון המקומי.

from datasets import load_dataset

ds = load_dataset("anisoleai/fineweb-tokenized")

הרישיון

המאגר מופץ תחת רישיון odc-by, שמתיר שימוש מסחרי, שינוי והפצה של הנתונים. הדרישה העיקרית היא מתן קרדיט וייחוס מתאים ליוצרי המאגר ולפרויקט FineWeb המקורי בכל מוצר, מחקר או מודל שמתבסס עליהם.

הרישיון המלא ב־Hugging Face ↗