GPT
S

smol-smoltalk

קוד פתוח

HuggingFaceTBapache-2.02024-11-21

  • synthetic

אוסף שיחות מסונן ומקוצר שנועד לאימון מודלי שפה זעירים של פחות ממיליארד פרמטרים. הוא מנפה משימות כבדות ומורכבות כדי להתאים לקיבולת הזיכרון והלמידה של מודלים קטנים במיוחד.

  • 14,220הורדות בחודש
  • 121לייקים

מה זה

מדובר בתת קבוצה מכווצת ומותאמת מתוך המאגר SmolTalk, שנוצרה על ידי HuggingFace לצורך כוונון עדין של מודלי SmolLM2 הקטנים (135M ו־360M). הנתונים מכילים בין 100 אלף למיליון שיחות והוראות, שמגיעות בעיקר ממקורות כמו Smol-Magpie-Ultra, אך בגרסה מקוצרת בהרבה.

בניגוד למאגר המקורי המלא, הסינון כאן הוציא בכוונה נתונים מורכבים שמודלים קטנים לא מצליחים להכיל. אין כאן דוגמאות לקריאות לפונקציות, כמעט ואין משימות שכתוב או סיכום טקסט, והושמטו לחלוטין מאגרי מתמטיקה מתקדמת. הפיצול במאגר כולל חלוקה לסט אימון (train) וסט בדיקה (test).

מתאים ל

  • אימון מודלים עד 1B

    כוונון מודלי שפה זעירים למכשירים חלשים או edge, שבהם דוגמאות ארוכות ומסובכות רק מפריעות ללמידה.

  • בניית צ'אטבוט בסיסי באנגלית

    אימון בסיסי לניהול שיחות קצרות ומענה לשאלות פשוטות בשפה האנגלית בלבד.

  • מחקרי יעילות נתונים

    בדיקת השפעת סינון דוגמאות מורכבות על ביצועי מודלי שפה בעלי קיבולת נמוכה.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין פה טיפת עברית. אם אתם בונים מודל שאמור לדבר עם משתמשים ישראלים או לעבד טקסט מקומי, המאגר לא יעזור לכם בלי תרגום או שילוב מקורות נוספים. מעבר לכך, הוצאת המתמטיקה המתקדמת והקריאות לפונקציות הופכת אותו לבלתי מתאים לחלוטין עבור מודלים שצריכים לפתור בעיות היגיון מורכבות או לשמש כסוכנים שמפעילים כלים חיצוניים.

שאלות
נפוצות

האם יש במאגר שיחות בעברית?

לא. המאגר כולו מוגדר באנגלית בלבד. אם אתם מאמנים מודל לשוק הישראלי, תצטרכו להביא מקורות נתונים נפרדים בשפה העברית.

במה הוא שונה מ־SmolTalk המקורי?

השיחות כאן קוצרות משמעותית כדי לחסוך בהקשר. בנוסף, הוסרו ממנו משימות מתמטיקה מתקדמת, קריאות לפונקציות, ורוב דוגמאות הסיכום והשכתוב, מאחר שהן מיועדות למודלים עם פחות ממיליארד פרמטרים.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים ולשלב אותם במוצרים מסחריים בלי לשתף את הקוד שלכם.

איזה מודלים אומנו על הדאטהסט הזה בפועל?

צוות HuggingFace השתמש בו לאימון מודלי ההוראות SmolLM2-135M-Instruct ו־SmolLM2-360M-Instruct בשלב ה־SFT. לאחר מכן הם ביצעו יישור באמצעות DPO על מאגר אחר בשם UltraFeedback.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של פייתון בפקודה load_dataset עם המזהה HuggingFaceTB/smol-smoltalk. המאגר פתוח לציבור ואינו דורש הרשאה מיוחדת או אישור גישה. הקבצים מגיעים בפורמט parquet, מחולקים לארבעה קבצי train וקובץ test יחיד, כך שהטעינה מהירה ומתאימה לעבודה בסביבות אימון מקומיות או מבוזרות.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/smol-smoltalk")

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים, וכן אימון מודלים ללא דרישה להפיץ את התוצר תחת אותו רישיון. החובה העיקרית היא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗