GPT
F

fineweb-edu-classifier

קוד פתוח

HuggingFaceFWapache-2.02024-05-06

  • transformers
  • safetensors
  • bert
  • text-classification
  • en

מסווג קטן שמעריך כמה עמוד רשת הוא חינוכי בסולם של אפס עד חמש. הוא נועד לסנן דאטהסטים גדולים לקראת אימון מודלי שפה, בלי להוציא הון על קריאות ל־LLM.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 419 MBמשקל הקבצים
  • 10,328הורדות בחודש

מה זה

המודל מבוסס על Snowflake-arctic-embed בארכיטקטורת ברט עם 109 מיליון פרמטרים, שעליו אימנו ראש רגרסיה ייעודי. האימון נעשה על 450,000 דגימות טקסט באנגלית מתוך FineWeb, שתוייגו על ידי Llama 3 70B Instruct. המטרה שלו היא לשחזר את הציונים של המודל הגדול בעלות חישובית אפסית כמעט.

במבחן התוצאה, כשמסתכלים על סיווג בינארי עם סף ציון של שלוש ומעלה, הוא מגיע לציון F1 של 82 אחוזים. עם זאת, בדירוג המדויק לפי מחלקות יש לו פיזור משמעותי, והדיוק הכללי שלו עומד על 71 אחוזים על סט בדיקה של כמעט 47,000 דגימות. הוא טוב בעיקר בהפרדה בין תוכן זבל מוחלט לבין טקסט שיש בו ערך לימודי בסיסי, ופחות בקליעה מדויקת לציון הספציפי.

מתאים ל

  • סינון דאטה לאימון מודלים

    ניקוי מהיר של טקסטים גולמיים מהרשת כדי להשאיר רק תוכן לימודי איכותי ברף של שלוש ומעלה.

  • דירוג תוכן במנועי חיפוש

    תעדוף עמודים עשירים במידע לימודי באנגלית על פני דפי נחיתה וספאם בתוך אינדקס קיים.

  • מיון ראשוני במאגרי ידע

    חלוקת עשרות אלפי מאמרים לרמות איכות באופן אוטומטי ובלי עלויות של מודל שפה גדול.

איפה זה נופל

הוא אומן אך ורק באנגלית ונוטה להתבלבל בטקסטים מחוץ להתפלגות של FineWeb. לפי כרטיס המודל, המיקוד שלו הוא רמת בית ספר יסודי ותיכון, והוא מתקשה לזהות תוכן אקדמי מתקדם או תחומים מקצועיים צרים. בנוסף, בציון חמש ה־F1 שלו צונח ל־0.02 עם recall של מאית אחת, כלומר הוא כמעט אף פעם לא מזהה נכון את הטקסטים המצטיינים ביותר. הוא גם נוטה לתת ציונים גבוהים לטקסט רק כי הוא נראה אקדמי מבחינה ויזואלית, והוא מוגבל ל־512 טוקנים ללא הקשר רחב יותר של האתר.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כדי לסנן טקסטים בעברית?

לא. המודל אומן על נתונים באנגלית בלבד מתוך FineWeb, ואין לו יכולת להעריך נכון תוכן בעברית. הרצה על טקסט עברי תניב ציונים אקראיים לחלוטין.

איך הכי נכון להשתמש בציון שהמודל פולט?

היוצרים ממליצים לחתוך בסף של שלוש ומעלה כסיווג בינארי בין תוכן איכותי ללא איכותי. אל תסתמכו על הציונים ארבע וחמש כמדד אמין למצוינות, כי המודל כמעט ולא פוגע בהם.

איך מריצים

במשקל של 419 מגה בייט וחלון של 512 טוקנים, אפשר להריץ אותו מקומית על כל מעבד סביר בלי לגעת ב־GPU. הוא רץ ישירות דרך ספריית transformers בפייתון ומחזיר מספר ממשי שמייצג את הציון, אותו מעגלים לרוב למספר שלם בין אפס לחמש.

אם אתם צריכים לסנן מיליוני עמודים, אין שום היגיון לשלם ל־API חיצוני. מריצים אותו באצ'ים על שרת פשוט ומסיימים כמויות דאטה ענקיות במהירות. לעומת זאת, אם אתם בודקים רק כמה עשרות מסמכים ביום, קריאה פשוטה ל־LLM קיים תחסוך לכם את הצורך להחזיק קוד וסביבת ריצה.

from transformers import pipeline

pipe = pipeline("text-classification", model="HuggingFaceFW/fineweb-edu-classifier")
print(pipe("שלום"))

הרישיון

רישיון apache 2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה חופשית של המודל בתוך המוצר שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובת פתיחת קוד משלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗