GPT
S

SmolLM-360M-Instruct

קוד פתוח

HuggingFaceTBapache-2.02024-07-15

  • transformers
  • onnx
  • safetensors
  • llama
  • text-generation

מודל שיחה זעיר שמתאים לריצה ישירה על מכשירי קצה או בדפדפן. הוא מציע יכולת שיחה בסיסית באנגלית בלי תלות בחומרה כבדה או בשרתים מרוחקים.

  • 362Mפרמטרים
  • 2,048טוקנים בהקשר
  • 4.7 GBמשקל הקבצים
  • 12,811הורדות בחודש

מה זה

מדובר במודל שפה קומפקטי שמיועד לשיחה, אומן על דאטה חינוכי וסינתטי, ועבר התאמה מיוחדת לענות לפרומפטים יומיומיים ולהישאר ממוקד בנושא. בגרסה העדכנית שלו, v0.2, הוא מציג אחוז הצלחה של 63.3% מול הגרסה הראשונה במבחן AlpacaEval, בעיקר בגלל שינוי בתמהיל הדאטה שכולל שיחות פשוטות שיצר מודל גדול יותר, דוגמאות קוד של StarCoder2 וחלקים מ־OpenHermes.

בפועל הוא יודע לענות על שאלות ידע כללי, לכתוב טקסטים יצירתיים קצרים ולהתמודד עם משימות פייתון פשוטות. הוא שונה מרוב המודלים בזה שהוא לא מנסה להתחרות בענקים, אלא נבנה מראש לתפקד בסביבות מקומיות מוגבלות מאוד שבהן אי אפשר לדחוף עשרות מיליארדי פרמטרים.

מתאים ל

  • עוזר מקומי בדפדפן

    רץ ישירות בצד לקוח עם Transformers.js ו־WebGPU בלי לשלוח שום מידע לשרת חיצוני.

  • בוט שיחה על מעבד פשוט

    מתאים לשיחות יומיומיות קצרות באנגלית על חומרה מקומית חלשה או מכשירי קצה.

  • סיוע בכתיבת פייתון בסיסי

    אימוני StarCoder2 מאפשרים לו לייצר פונקציות קצרות ופשוטות בלי חיבור לרשת.

איפה זה נופל

המודל תומך באנגלית בלבד, ואין לו שום תמיכה בעברית לפי המפרט. בנוסף, הוא מתקשה מאוד בחשבון, בעריכת טקסטים ובמשימות שדורשות חשיבה לוגית מורכבת.

התוצרים שלו עלולים להכיל שגיאות עובדתיות וחוסר עקביות. חלון ההקשר מוגבל ל־2,048 טוקנים, כך שאי אפשר להזין אליו מסמכים ארוכים או לנהל איתו שיחות עמוקות בלי שיאבד את ההקשר.

אותה משפחה

SmolLM יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי לכווץ אותו ל־4 ביט כדי לחסוך זיכרון?

היוצרים בדקו את זה וגילו שכימות ל־4 ביט פוגע קשות בביצועים של הגרסה הזו. ההמלצה הרשמית שלהם היא להישאר בפורמט q016 כשמריצים ב־MLC או בדפדפן.

אפשר להשתמש בו בעברית?

לא. המודל אומן והוגדר עבור השפה האנגלית בלבד, וכל ניסיון לעבוד איתו בעברית יספק תוצאות שבורות או חסרות משמעות.

איך אפשר לקבל ממנו תוצאות טובות יותר?

עדיף לעבוד עם גרסת v0.2 ומעלה, ולהגדיר את פרמטרי הריצה לפי המלצת המפתחים: טמפרטורה 0.2 ו־top-p על 0.9.

איך מריצים

אפשר להריץ אותו ישירות דרך ספריית transformers בפייתון על כרטיס מסך או ישירות על המעבד, ואפילו דרך שורת הפקודה עם כלי ה־chat של trl. המודל זמין גם בפורמטים מותאמים לריצה מקומית כמו GGUF, MLC ובאמצעות Transformers.js בתוך דפדפנים עם תמיכה ב־WebGPU. היוצרים מציינים שכימות ל־4 ביט פוגע קשות באיכות בגודל הזה, ולכן ממליצים להישאר בפורמט q016 עבור MLC ו־ONNX, ולהגדיר טמפרטורה של 0.2 עם top-p של 0.9.

בגלל המשקל הנמוך, אין שום צורך לפנות ל־API חיצוני או להחזיק שרת יקר. מחשב נייד פשוט או מכשיר קצה יכולים להריץ אותו בלי להזיע.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceTB/SmolLM-360M-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. זה אומר שמותר להשתמש בו לשימוש מסחרי חופשי, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים סגורים, כל עוד שומרים על הודעת הרישיון המקורית ומצהירים על שינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗