GPT
F

finephrase

קוד פתוח

HuggingFaceFWodc-by2026-02-15

  • SmolLM2-1.7B-Instruct
  • fineweb-edu
  • synthetic
  • datatrove

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

מאגר ענק של טקסטים שעובדו מחדש בעזרת מודל שפה קטן כדי לספק נתונים סינתטיים מובנים לאימון. הוא מיועד למי שרוצה לשפר יכולות הבנה, הוראות והסקה במודלים שלו בלי לגרד מיליארדי אתרים בעצמו.

  • 363,772הורדות בחודש
  • 147לייקים

מה זה

מדובר במאגר נתונים סינתטי בהיקף חריג שנבנה ישירות מתוך מדגם של fineweb-edu. צוות הפיתוח לקח מעל 339 מיליון מסמכי מקור והעביר אותם עיבוד מחדש באמצעות המודל SmolLM2-1.7B-Instruct. במקום להשאיר את הטקסט בצורתו הגולמית מהרשת, המודל שכתב כל מסמך לתצורות מובנות היטב שנועדו להקל על מודלים ללמוד קשרים, מבנה ונימוקים.

המאגר מחולק לארבע תצורות עבודה עיקריות, ולכל אחת מהן יש תת מאגר ייעודי. התצורה הראשונה היא faq, שממירה את המסמך לשאלות ותשובות מקיפות ועצמאיות. השנייה היא math, שבונה בעיות מילוליות מבוססות חישוב על בסיס הנתונים במסמך יחד עם פתרון מודרך צעד אחר צעד. התצורה השלישית היא table, שמארגנת את המידע בטבלת מרקדאון ומצרפת שאלת הבנה ותשובה. התצורה הרביעית היא tutorial, שמארגנת את התוכן כמדריך צעדים לימודי.

מתאים ל

  • אימון מקדים מוכוון הוראות

    שימוש בטקסטים מובנים כדי לשפר יכולת של מודל קטן לעקוב אחרי פורמטים.

  • יצירת מערכי שאלות ותשובות

    שליפת צמדי שאלות מבוססי טקסט לאימון מנועי חיפוש ושאילתות ידע.

  • לימוד חילוץ מידע לטבלאות

    אימון מודלים להמרת טקסט חופשי למבנה נתונים מוגדר ומיושר.

איפה זה נופל

כל המידע הסינתטי נוצר על ידי מודל שפה של 1.7 מיליארד פרמטרים, גודל צנוע מאוד למשימות מורכבות. המודל עלול לייצר שגיאות חישוב, עובדות מומצאות והזיות, בייחוד בחלק של המתמטיקה. טקסטים ארוכים במקור נחתכו בגלל מגבלות הקשר, ומסמכים שנכשלו פשוט נשרו מהריצה. בנוסף, המאגר באנגלית בלבד. אם המטרה שלכם היא עברית או אימון מוצר קצה שדורש דיוק עובדתי מוחלט, אל תזינו את הנתונים האלה בלי סינון או בדיקה מקדימה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

כן, רישיון odc-by מאפשר שימוש מסחרי מלא באימון מודלים ובבניית מוצרים. הדרישה העיקרית היא הוספת ייחוס מתאים למחברי המאגר במסמכי המוצר או בקוד. אין חובה לחשוף מודלים שאימנתם תחת אותו רישיון.

כמה המאגר הזה שוקל ואיך מורידים אותו בלי לחנוק את המחשב?

המאגר כולל מעל 1.35 מיליארד רשומות ומאות מיליארדי טוקנים שמפוזרים על פני יותר מ־27,000 קובצי parquet. במקום להוריד את קונפיגורציית all בבת אחת, כדאי לטעון רק קונפיגורציה בודדת כמו math או faq. בנוסף, מומלץ להשתמש בהזרמה כדי לחסוך מקום בדיסק.

האם הדאטהסט כולל נתונים בעברית?

לא, הנתונים מוגדרים באנגלית בלבד. מקור המידע הוא fineweb-edu שעבר עיבוד על ידי פרומפטים באנגלית, כך שאין כאן תוכן ישראלי או מקומי. אימון מודל לעברית ידרוש תרגום מסיבי או שימוש במקורות אחרים.

איך הנתונים האלה נוצרו בפועל?

צוות הפיתוח השתמש בספריית DataTrove והריץ את המודל SmolLM2-1.7B-Instruct על גבי 339 מיליון מסמכים. לכל מסמך הוצמד אחד מארבעה פרומפטים שונים שהורו לו לנסח מחדש את התוכן כשאלות נפוצות, בעיה מתמטית, טבלה או מדריך. התוצאות נשמרו ישירות יחד עם מידע הטוקנים של הריצה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets על ידי ציון שם המאגר והקונפיגורציה הרצויה, כמו faq או all. המאגר מורכב מעשרות אלפי קובצי parquet, כך שהורדה של הכל בבת אחת תדרוש נפח אחסון עצום וחיבור חזק. אין צורך באישור גישה מיוחד כדי להוריד. בכל רשומה חשוב לשים לב שהשדה text מכיל דווקא את טקסט המקור מתוך fineweb-edu, בעוד שהפלט הסינתטי שנוצר נמצא עמוק יותר בתוך השדה הייעודי תחת rollout_results, יחד עם נתוני השימוש ומספר הטוקנים.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/finephrase")

הרישיון

המאגר מופץ תחת רישיון odc-by. מותר להשתמש בו לצרכים פנימיים, מחקריים ומסחריים, כולל אימון מודלים חדשים. התנאי המרכזי כאן הוא מתן קרדיט וייחוס הולם למפרסמים המקוריים בכל שימוש או הפצה של הנתונים. אין חובת שיתוף באותו רישיון, כך שאפשר לשמור על תוצרי המודל שלכם קנייניים.

הרישיון המלא ב־Hugging Face ↗