GPT
F

FineFineWeb

קוד פתוח

m-a-papache-2.02024-12-14

חלוקה ממוקדת של FineWeb לשישים ושבעה תחומי ידע שונים. מתאים למי שרוצה לאמן או לסנן דאטה לפי תחום ספציפי בלי לקחת את כל הרשת.

  • 1,837,605הורדות בחודש
  • 175לייקים

מה זה

המאגר מפרק את FineWeb לעשרות קטגוריות תוכן, ומכיל 6,536,072,879 רשומות שמצטברות לכדי 4,425.30 מיליארד טוקנים באנגלית. תהליך הסינון התחיל בהסרת כפילויות מדויקת ובשיטת MinHash. מיליון כתובות הרשת הראשיות הנפוצות ביותר תויגו באמצעות GPT-4 כדי להגדיר תחומי עניין.

לאחר מכן הופעל תהליך שאיבה בשלושה סבבים. מודל Qwen2-7B-Instruct תייג דגימות עבור אימון מסווגי FastText לסינון גס, ומודל Qwen2-72B-Instruct תייג דוגמאות עבור אימון מודלי BERT שביצעו את הסינון העדין. כל תחום מחולק לשלוש איטרציות של איסוף וסינון, כשהסבב הראשון מחזיק ברוב הנפח המוחלט של הטקסט.

מתאים ל

  • אימון מודלים ייעודיים

    שאיבת טקסטים מתחום ספציפי, כמו רפואה או משפטים, כדי לבצע אימון מקדים ממוקד בתחום ידע יחיד.

  • איזון יחסים באימון כללי

    שליטה ידנית בהרכב הנושאים של מודל שפה כללי על ידי דגימה מותאמת מתוך 67 התחומים המוגדרים.

  • מחקר על דמיון בין תחומים

    הערכת ההשפעה של חלוקה נושאית מבוססת מסווגים על מדדי איכות ומבחני הערכה שונים.

איפה זה נופל

הטקסט כולו באנגלית, כך שאין כאן שום מענה לאימון בשפות אחרות. ניתוח הדמיון של היוצרים מראה שכמעט ואין במאגר נתוני קוד, והמרחק שלו ממבחני קוד כמו MBPP ו־HumanEval גדול מאוד. בנוסף, קטגוריות כמו הימורים הציגו מרחק מובהק מכל מבחני הביצועים המקובלים ואינן תורמות להם. תחומים מסוימים, במיוחד pet, topicality ו־atmospheric science, סובלים משיעורי כפילות כתובות גבוהים יחסית לשאר המאגר.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד.

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

כן. הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי מלא ומסירת תוצרים ללא דרישת Copyleft, בכפוף למתן קרדיט וצירוף תנאי הרישיון המקורי.

איך אפשר להתמודד עם הגודל העצום של הדאטה?

הנתונים פרוסים על פני 66,109 קובצי jsonl ומסודרים בתיקיות נפרדות לפי 67 תחומי ידע. אין חובה להוריד את כל 4.4 טריליון הטוקנים, אלא מושכים רק את התיקיות של התחומים שמעניינים אתכם.

במה הוא שונה מ־FineWeb הרגיל?

הוא לוקח את החומר הגולמי של FineWeb ומפעיל עליו שרשרת סינון מבוססת GPT-4, מודלי Qwen, FastText ו־BERT. במקום רצף טקסט אחיד מהרשת, מקבלים נתונים מתויגים ומסווגים לקטגוריות תוכן מוגדרות.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך בהרשאת גישה מוקדמת. הנתונים מחולקים לתיקיות לפי נושאים, כמו תעופה או כלכלה, ומאוחסנים בפורמט jsonl בתוך 66,109 קבצים שונים. בגלל שמדובר באלפי מיליארדי טוקנים, לא טוענים הכל בבת אחת. מורידים רק את קובצי ה־jsonl של התחום שבו רוצים לעבוד, או מזרימים את הרשומות בקריאה ישירה.

from datasets import load_dataset

ds = load_dataset("m-a-p/FineFineWeb")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, מחקרי ושינוי של החומר, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. אין חובת שיתוף באותו רישיון עבור תוצרים או מודלים שאומנו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗