GPT
S

SmolLM-135M-Instruct

קוד פתוח

HuggingFaceTBapache-2.02024-07-15

  • transformers
  • onnx
  • safetensors
  • llama
  • text-generation

מודל שפה זעיר עם 135 מיליון פרמטרים שרץ ישירות על מעבד מקומי או בדפדפן. פתרון ממוקד למי שצריך תגובות טקסט בסיסיות באנגלית בלי שרתים ייעודיים ובלי עלויות ענן.

  • 135Mפרמטרים
  • 2,048טוקנים בהקשר
  • 1.8 GBמשקל הקבצים
  • 34,091הורדות בחודש

מה זה

המודל הזה שייך לסדרת המודלים הקטנים של Hugging Face, ועבר אימון על דאטה סינתטי וחומרי הדרכה ייעודיים, לצד כוונון עדין למענה על הוראות. בגרסה v0.2 שלו הוסיפו שיחות יומיומיות שנוצרו כדי לשפר את היכולת שלו להישאר ממוקד ולא לסטות מהנושא בפניות רגילות.

הוא שונה מרוב המודלים הגדולים בכך שהוא לא מנסה לדעת הכל, אלא להביא יכולת גנרטיבית קלה במיוחד לחומרה חלשה. הוא מצליח לענות על שאלות ידע כללי, לכתוב טקסט חופשי, ולייצר קטעי פייתון בסיסיים, כל עוד הדרישות נשארות פשוטות ולא דורשות שרשראות חשיבה ארוכות.

מתאים ל

  • הרצה מקומית בדפדפן

    הוא קל מספיק לעבוד עם Transformers.js ו־WebGPU ישירות אצל הלקוח בלי להחזיק שרת.

  • בוט פקודות פשוט באנגלית

    גרסת v0.2 יודעת לקבל ברכות ולענות על שאלות בסיסיות על תפקידה בלי להתפזר.

  • יצירת קוד פייתון קצר

    הוא אומן בין היתר על דאטה של StarCoder2 ומסוגל לייצר פונקציות פייתון פשוטות.

איפה זה נופל

המודל תומך באנגלית בלבד. עברית לא נתמכת כאן, ואם תנסו להזין לו שפות אחרות התוצאות ישברו. בנוסף, הוא מתקשה מאוד בחשבון, בעריכת טקסט ובהיגיון מורכב, והתשובות שלו עשויות להכיל טעויות עובדתיות או חוסר עקביות לוגית.

חלון ההקשר מוגבל ל־2,048 טוקנים, כך שאי אפשר להזין לו מסמכים שלמים. לא הייתי משתמש בו לשום משימה שדורשת דיוק מתמטי, הסקת מסקנות רב שלבית או שליפת מידע אמין.

אותה משפחה

SmolLM יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן והוגדר עבור אנגלית בלבד. ניסיון לכתוב לו בעברית יוביל לפלט משובש או חסר היגיון, והוא לא מתאים למשימות מקומיות בישראל שדורשות הבנת השפה.

למה לא להשתמש בגרסת 4 ביט כדי לחסוך זיכרון?

היוצרים בדקו ומצאו שכימות של 4 ביט פוגע קשות באיכות הפלט בגדלים קטנים כאלה של 135 מיליון פרמטרים. מאחר שהמשקל הכולל של הקבצים הוא ממילא רק 1.8 ג'יגה בייט, עדיף להריץ אותו בפורמטים כמו q016 או בדיוק המקורי.

איך בוחרים בין גרסת v0.1 ל־v0.2 בקוד?

ברירת המחדל בטעינה מורידה את הגרסה העדכנית ביותר. אם תרצו לטעון דווקא את v0.1 לצורכי השוואה, אתם מעבירים את הפרמטר revision עם הערך v0.1 לפונקציית הטעינה של transformers.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון או דרך ממשק הטרמינל של TRL, והוא רץ בלי בעיה ישירות על ה־CPU של מחשב רגיל בלי לגעת ב־GPU. המודל זמין גם בפורמטים מותאמים כמו GGUF ו־Transformers.js להרצה בדפדפן דרך WebGPU. המפתחים מציינים שכימות של 4 ביט פוגע באיכות בגודל הזה, ולכן מומלץ לעבוד בדיוק מלא יותר כמו q016 או המשקלים הרגילים, עם טמפרטורה של 0.2 ו־top-p של 0.9.

אם אתם צריכים רק להשלים טקסט בסיסי באפליקציה מקומית או במכשיר קצה, אין שום סיבה לשלם על API חיצוני. מנגד, אם המשימה שלכם כוללת לוגיקה מורכבת או שפות שאינן אנגלית, חבל על זמן הריצה המקומי ועדיף לפנות למודל גדול יותר בענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceTB/SmolLM-135M-Instruct")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי, בלי חובת פתיחת הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗