GPT
S

smoltalk2

קוד פתוח

HuggingFaceTBרישיון לא דווח2025-07-10

המאגר מרכז דאטה מעובד לאימון שלאחר אימון מקדים, כולל שרשראות חשיבה ושיחות מיושרות. הוא מיועד למי שרוצה לאמן מודלים קומפקטיים בדיוק לפי המתכון ששימש לבניית SmolLM3-3B.

  • 20,888הורדות בחודש
  • 171לייקים

מה זה

הנתונים מחולקים לשלושה חלקים שמייצגים שלבי עבודה שונים: Mid שמכיל 4.8 מיליון שורות משני מקורות עבור mid-training, שלב ה־SFT שמורכב מ־25 תת-מאגרים, ושלב ה־Preference עם 447 אלף דוגמאות שנועדו לאימון APO. הדוגמאות עברו ניקוי קפדני שכלל הסרת דליפות ממבחני ביצועים נפוצים ומחיקה של אימוג'ים.

בתוך שלב ה־SFT יש הפרדה ברורה בין 10 מאגרים הכוללים שרשראות חשיבה עם הסיומת think, לבין 15 מאגרים ללא שרשראות כאלו עם הסיומת no_think. חלק מהדאטה נוצר ישירות באמצעות מודלים כמו Qwen3-32B ו־DeepSeek-V3-0324 עבור יכולות הפעלת כלים, ניסוח מחדש ושיחות מרובות תורות.

חלק העדפות כולל גרסה רגילה שמבוססת על Tulu 3 וגרסה שכוללת חשיבה, שבה התשובות שנבחרו נוצרו על ידי מודל 32B והתשובות שנדחו נוצרו על ידי מודל 0.6B.

מתאים ל

  • אימון הוראות עם חשיבה

    שימוש בתת-מאגרי think לצורך לימוד מודלים להפיק שרשראות חשיבה שלמות לפני מתן תשובה סופית.

  • כוונון לפעולות כלים

    אימון סוכנים אוטומטיים באמצעות דוגמאות קריאה לכלים מתוך smolagents ו־hermes.

  • יישור העדפות באלגוריתם APO

    הרצת שלב Preference עם זוגות תשובות מדורגות הכוללות גרסאות חשיבה מתקדמות.

  • אימון ביניים למודלים קטנים

    הרחבת יכולות הבסיס של מודל קיים בעזרת 4.8 מיליון שורות Mid נקיות מדליפות מבחנים.

איפה זה נופל

החלק הרב-לשוני של המאגר מכסה שמונה שפות בלבד: צרפתית, ספרדית, איטלקית, פורטוגזית, גרמנית, ערבית, רוסית וסינית. עברית לא נכללת בפילוח הזה. בנוסף, חלק גדול מהתשובות ושרשראות החשיבה הן נתונים סינתטיים שנוצרו על ידי מודלים ממשפחת Qwen3 ו־DeepSeek, מה שעלול לייבא הטיות ספציפיות של המודלים האלה. תצטרכו לבדוק את איכות ההסברים לפני שאתם דוחפים אותם למוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

אין תשובה אחת לכל המאגר. החלקים החדשים שנוצרו לפרויקט זמינים תחת רישיון Apache 2.0 שמאפשר שימוש מסחרי, אך חלקים אחרים נשענים על מקורות חיצוניים כמו OpenThoughts או Tulu. תצטרכו לוודא את הרישיון המקורי של כל תת-מאגר שאתם מכלילים באימון שלכם.

האם המאגר מתאים לעבודה בעברית?

לא באופן מובנה. החלק הרב-לשוני של המאגר תורגם לשמונה שפות ספציפיות שאינן כוללות עברית. רוב שאר הטקסטים והשיחות הם באנגלית, כך שתידרשו להוסיף מקורות נפרדים כדי לאמן יכולות בעברית.

איך נאסף המידע שבתוך המאגר?

המאגר מורכב משילוב של מאגרי קוד פתוח קיימים לצד נתונים סינתטיים חדשים. חלק מהתשובות ושרשראות החשיבה הופקו בעזרת מודלים כמו Qwen3-32B ו־DeepSeek-V3, וכלל החומרים עברו סינון להסרת אימוג'ים ומניעת דליפה מתוך מבחני הערכה מקובלים.

מה מייחד את המאגר לעומת אוספי SFT רגילים?

הוא בנוי ומכויל בדיוק לפי שלבי העבודה ששימשו לבניית SmolLM3-3B, עם משקלים מוגדרים לכל מקור. החלוקה הברורה בין נתונים עם חשיבה לנתונים ישירים חוסכת את הצורך לסנן ולבודד שרשראות הסבר בעצמכם.

איך טוענים

אתם טוענים את הדאטה ישירות דרך הספרייה datasets של Hugging Face בלי צורך באישור גישה. המאגר כולל 402 קבצי Parquet שמחולקים לפי השלבים. אפשר לבחור לטעון רק תת-מאגר ספציפי ופיצול רצוי מתוך ה־SFT, למשל נתונים של שיחות או שאלות מדעיות, במקום להוריד עשרות מיליארדי טוקנים בבת אחת. מומלץ לשים לב לעמודה chat_template_kwargs שמכילה הודעות מערכת ותיאורי כלים שחולצו מראש.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/smoltalk2")

הרישיון

למאגר בכללותו אין רישיון אחיד. הדאטהסטים החדשים שהופקו עבור הפרויקט הזה שוחררו תחת רישיון Apache 2.0 שמתיר שימוש מסחרי חופשי, אך שאר החלקים מורכבים מדאטהסטים ציבוריים קיימים שלכל אחד מהם רישיון מקורי משלו. אם אתם מתכננים לאמן מודל מסחרי, לא תוכלו להסתמך על הגדרה בודדת ותצטרכו לבדוק את תנאי הרישיון של כל מקור ומקור.

הרישיון המלא ב־Hugging Face ↗