GPT
S

smoltalk

קוד פתוח

HuggingFaceTBרישיון לא דווח2024-11-17

  • synthetic

מיליון דוגמאות סינתטיות שנועדו לאימון הוראות במודלי שפה קטנים. האוסף נבנה כדי לתת מענה לחולשה של מודלים פתוחים במשימות שכתוב, תמצות ועמידה באילוצים מורכבים.

  • 55,631הורדות בחודש
  • 430לייקים

מה זה

המאגר מחולק לשני מקורות עיקריים. החלק הראשון כולל ארבע תתי קבוצות חדשות שנוצרו בכלי distilabel. הבסיס המרכזי שם הוא Smol-Magpie-Ultra עם 400 אלף שיחות שעברו סינון קפדני ונוצרו דרך Llama 3.1 405B, לצד 36 אלף דוגמאות לאימון על עמידה באילוצים שעברו ניקוי מול מבחן IFEval, עוד 50 אלף דוגמאות לשכתוב טקסט ושינוי משלב, ו־100 אלף דוגמאות לתמצות מיילים וחדשות.

החלק השני מורכב מדגימות מתוך מאגרים פתוחים קיימים כדי לסגור פערים ביכולות ספציפיות. הצוות שילב 100 אלף דגימות מ־OpenHermes 2.5, נתונים מ־MetaMathQA ו־NuminaMath-CoT לחיזוק מתמטיקה, קוד מ־Self-Oss-Starcoder2, כ־80 אלף קריאות לפונקציות מ־APIGen, שיחות יומיומיות קצרות, וטקסטים ארוכים עד 16 אלף תווים מ־LongAlign כדי למנוע קריסה בהקשרים מעבר ל־2048 טוקנים.

מתאים ל

  • אימון SFT למודלים קטנים

    כוונון ישיר של מודלים בגודל 1B עד 7B כדי לשפר דיוק בהבנת הוראות, פתרון מתמטיקה וקריאה לפונקציות.

  • שיפור דיוק במעקב אחרי אילוצים

    אימון ממוקד באמצעות תת המאגר של האילוצים, כדי להכריח מודל להחזיר מספר מילים מדויק או מבנה מבוקש.

  • כוונון משימות עריכה ותמצות

    שימוש בחלקי השכתוב והסיכום כדי לבנות עוזר ייעודי לעריכת מסמכים, מענה למיילים ושינוי סגנון כתיבה.

איפה זה נופל

אין כאן שום מידע בעברית, כל המאגר מוגדר ומבוסס על השפה האנגלית בלבד. אם תאמנו עליו מודל בלי תוספת נתונים מקומית, תקבלו אפס יכולת שיחה בעברית.

בנוסף, הליבה נשענת על פלטים סינתטיים שנלקחו ממודל Llama 3.1 405B. זה אומר שההטיות, הטעויות הסמויות והסגנון של המודל המקורי עברו ישירות לתוך הדאטהסט, למרות הסינון שהיוצרים ביצעו.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מוגדר באנגלית בלבד וכל תתי המאגרים המרכיבים אותו כוללים טקסטים באנגלית. כדי לעבוד בעברית תצטרכו לתרגם דגימות או לשלב מאגרי הוראות מקומיים.

האם מותר להשתמש בזה למוצר מסחרי?

התשובה תלויה בחלקים שבהם אתם משתמשים. החלקים החדשים שוחררו תחת Apache 2.0, אבל המאגר כולל דאטהסטים ציבוריים נוספים ונתונים שנוצרו על ידי מודל Llama, כך שצריך לבדוק את הרישיון המקורי של כל תת קבוצה.

איך המאגר הזה שונה מ־OpenHermes או Magpie הרגיל?

הוא משלב סינון מחמיר יותר של שיחות Magpie לצד מנות מדודות של מתמטיקה, קוד וטקסטים ארוכים. לפי בדיקות היוצרים, השילוב הזה הביא לתוצאות גבוהות יותר במבחני IFEval ו־MT-Bench בהשוואה לאימון על המאגרים הוותיקים לבדם.

מה הגודל של המאגר?

המאגר מכיל מיליון דוגמאות אימון בסך הכל. הוא מחולק לקבצי Parquet לפי נושאים, וניתן להוריד רק את תת הקבוצה הרצויה במקום את כל המיקס.

איך טוענים

טוענים את המידע ישירות בספריית datasets בלי צורך באישור גישה. אפשר למשוך את כל המיקס יחד תחת השם all, או לטעון תת קבוצה ספציפית כמו smol-magpie-ultra לפי הצורך.

הקבצים שמורים בפורמט Parquet בחלוקה לכמה חלקים. האימון המקורי שביצעו יוצרי המאגר רץ עם אורך רצף של 8192 טוקנים, כך שאם אתם מאמנים על כלל הנתונים, כדאי לקחת בחשבון את דרישות הזיכרון של רצפים ארוכים.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/smoltalk")

הרישיון

המצב המשפטי כאן מורכב. החלקים החדשים שיוצרי המאגר ייצרו שוחררו תחת רישיון Apache 2.0 המתיר שימוש מסחרי, אבל שאר חלקי המאגר נלקחו ממקורות ציבוריים שונים שלכל אחד מהם רישיון מקורי משלו. בנוסף, השימוש בנתונים שיוצרו עם מודלי Llama כפוף לתנאי השימוש של חברת Meta. לפני שמשלבים את המודל המאומן במוצר מסחרי, חובה לעבור על הרישיונות של תתי המאגרים שנכללו באימון.

הרישיון המלא ב־Hugging Face ↗