GPT
S

SmolLM2-1.7B

קוד פתוח

HuggingFaceTBapache-2.02024-10-30

  • transformers
  • safetensors
  • llama
  • text-generation
  • en

מודל שפה קטן של 1.7 מיליארד פרמטרים שרץ בלי בעיה מקומית על לפטופ. הוא מאומן על 11 טריליון טוקנים ומתאים למי שמחפש ביצועים מהירים באנגלית בלי לשלם על שרתים כבדים.

  • 1.7Bפרמטרים
  • 8,192טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 380,106הורדות בחודש

מה זה

הגרסה הזו מגיעה מארכיטקטורת Llama רגילה עם 24 שכבות, אחרי אימון מאסיבי על FineWeb-Edu, DCLM ומאגרי קוד ומתמטיקה. המשקל שלו עומד על כ־3.2 גיגה בייט בלבד, מה שמאפשר לו להיכנס כמעט לכל זיכרון עבודה בלי להזיע.

במבחנים מול מודלים מקבילים כמו Llama-1B ו־Qwen2.5-1.5B, הוא מציג תוצאות חזקות בידע כללי והבנת שפה טבעית, למשל ציון של 68.7 ב־HellaSwag ו־60.5 ב־ARC. עם זאת, בגרסת הבסיס הזו הוא מקבל רק 31 נקודות ב־GSM8K, שזה חצי ממה ש־Qwen משיג באותו גודל, כך שלחישובים מתמטיים ישירים הוא פחות מרשים בלי כוונון ייעודי.

מתאים ל

  • השלמת טקסט במכשיר קצה

    צורך רק כ־3.4 גיגה זיכרון ויכול לרוץ ישירות על מעבד של מחשב נייד בלי חיבור לרשת.

  • עיבוד מסמכים באנגלית

    מאומן על 11 טריליון טוקנים ומספק תוצאות טובות בהבנת שפה וקריאה, כל עוד המידע באנגלית.

  • בסיס לכוונון עצמי

    גודל קומפקטי וארכיטקטורת Llama סטנדרטית שמאפשרים לאמן אותו מחדש על חומרה זולה יחסית.

איפה זה נופל

המודל תומך ומבין אנגלית בלבד. אם תנסו לתת לו קלט בעברית תקבלו ג'יבריש או תשובות שבורות לחלוטין, והוא לא מתאים כלל לממשקים מקומיים בארץ.

יוצרי המודל מציינים בפירוש שהתוכן שלו עלול לכלול שגיאות עובדתיות, הטיות וכשלים לוגיים. אסור להסתמך עליו כמקור ידע מוחלט, ולפני שמשלבים אותו בזרימת עבודה אמיתית חייבים להוסיף שכבת בדיקה לתוצאות שהוא פולט.

אותה משפחה

SmolLM2 יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ומייצר עברית?

לא. לפי התיעוד הרשמי הוא מיועד ומאומן בעיקר לאנגלית. ניסיונות לעבוד איתו בעברית יפיקו טעויות וניסוחים משובשים, כך שהוא אינו מתאים לשימושים מקומיים ללא אימון נוסף.

האם אפשר להריץ אותו בלי מעבד גרפי ייעודי?

כן, אפשר להעלות אותו ישירות על מעבד רגיל דרך transformers. בגלל המשקל הנמוך שלו, 3.2 גיגה בייט בלבד, הוא לא מעמיס על הזיכרון ויעבוד בקצב סביר לפיתוח ובדיקות.

האם כדאי להשתמש בו לפתרון שאלות הגיון וחשבון?

עדיף שלא. במבחני GSM8K גרסת הבסיס השיגה ציון של 31 בלבד, נמוך בהרבה ממתחרים ישירים באותה קטגוריית גודל, ולכן למשימות חישוביות כדאי לבחור מודל אחר או את גרסת ה־Instruct.

איך מריצים

כדי להריץ אותו צריך רק את ספריית transformers וכרטיס מסך פשוט או מעבד סביר. בטעינה עם bfloat16 הוא תופס בערך 3.4 גיגה בייט בזיכרון, כך שכל מעבד גרפי ביתי עם 6 עד 8 גיגה בייט VRAM יריץ אותו בקלות, וגם על גבי CPU הוא יזוז בקצב סביר.

אם אתם צריכים רק שאילתות בודדות או ניתוח של מיליוני מסמכים במקביל, שירותי ענן עם API יהיו פשוטים יותר לתחזוקה. הרצה עצמית שווה את זה כשחייבים פרטיות מלאה, עבודה ללא רשת, או כשיש לכם שרת קטן שפועל ממילא ורוצים לחסוך עלויות קריאה פר טוקן.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceTB/SmolLM2-1.7B")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 מלא וחופשי. אתם יכולים לקחת את המשקלים, לשלב אותם במוצר מסחרי סגור, לשנות אותם או להריץ אותם על שרתים שלכם בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗