GPT
S

SmolLM3-3B

קוד פתוח

HuggingFaceTBapache-2.02025-07-08

  • transformers
  • safetensors
  • smollm3
  • text-generation
  • conversational

זה מודל קטן עם שלושה מיליארד פרמטרים שמציע מנגנון חשיבה מובנה ותמיכה מורחבת בהקשר ארוך. הוא מיועד למי שרוצה להריץ מודל מקומית ועדיין לקבל יכולות ניתוח וקריאות לכלים.

  • 3.1Bפרמטרים
  • 65,536טוקנים בהקשר
  • 5.7 GBמשקל הקבצים
  • 577,998הורדות בחודש

מה זה

המודל הזה מגיע מבית Hugging Face ומנסה להביא יכולות של מודלים גדולים לתוך חבילה של 3B פרמטרים. השוני המרכזי כאן מול מודלים ותיקים באותו סדר גודל הוא מצב חשיבה כפול שמאפשר לו לייצר שרשרת מחשבה לפני התשובה, תמיכה מובנית בקריאה לכלים דרך XML או פונקציות פייתון, ואימון ייעודי על 11.2 טריליון טוקנים.

במדדי ההערכה הוא מציג תמונה ברורה. במצב רגיל בלי חשיבה הוא מוביל במעקב אחר הוראות מול מתחרים ישירים כמו Qwen2.5-3B ו־Llama3.1-3B עם תוצאה של 76.7 ב־IFEval, ומשיג 92.3 ב־BFCL לקריאת כלים. כשמפעילים את מצב החשיבה המורחב, הציון שלו במתמטיקה תחרותית של AIME 2025 קופץ מ־9.3 ל־36.7, וב־GSM-Plus מגיע ל־83.4. עם זאת, במשימות קוד מורכבות כמו LiveCodeBench v4 הוא נעצר ב־30.0 עם חשיבה, ונשאר מאחורי מודלים מעט גדולים יותר כמו Qwen3-4B.

מתאים ל

  • סוכני קוד פתוח מקומיים

    הוא מציע תמיכה מובנית בקריאות לכלים עם 92.3 ב־BFCL ונכנס בקלות לזיכרון של שרת צנוע.

  • פתרון בעיות מתמטיקה

    מצב החשיבה המורחב מקפיץ את הביצועים ב־AIME ל־36.7 ומספק מענה לשאלות חישוביות מורכבות.

  • עיבוד מסמכים ארוכים

    תמיכה ב־64k טוקנים מהקופסה והרחבה ל־128k מאפשרות להזין טקסטים שלמים בלי לחתוך מידע.

איפה זה נופל

המפתחים מציינים במפורש שהפלט עלול להכיל שגיאות עובדתיות, חוסר עקביות לוגית והטיות שמקורן בנתוני האימון. הוא לא מתאים לשמש כמקור מידע מוחלט. מעבר לכך, התמיכה בשפות מוגבלת. המודל אומן בעיקר על אנגלית, צרפתית, ספרדית, גרמנית, איטלקית ופורטוגזית, עם נתונים מעטים יותר בערבית, סינית ורוסית. עברית לא נכללת ברשימת השפות שנתמכות רשמית, ולכן צריך לבדוק אותו היטב לפני שמשלבים אותו בממשק עברי.

אותה משפחה

SmolLM3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך שולטים במצב החשיבה שלו?

אפשר להעביר את הדגלים think/ או no_think/ ישירות בתוך הודעת המערכת. לחלופין, בעבודה עם transformers מעבירים את המשתנה enable_thinking לפונקציית הטמפלייט, או שולחים אותו דרך chat_template_kwargs בבקשת ה־API לשרת כמו vLLM.

האם הוא יעבוד טוב בעברית?

עברית אינה מופיעה ברשימת השפות שהמודל אומן עליהן באופן רשמי. הוא נבדק בעיקר על שפות אירופיות, ערבית, סינית ורוסית, ולכן סביר להניח שרמת הדיוק והדקדוק בעברית תהיה נמוכה משמעותית.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.7 ג'יגה־בייט בפורמט bfloat16, כך שהוא נכנס בקלות לכרטיס מסך בודד עם 8 ג'יגה זיכרון, או אפילו לפחות מזה אם משתמשים בגרסאות מכווצות דרך llama.cpp, MLX או vLLM. כדי לעבוד איתו צריך לעדכן את ספריית transformers לגרסה 4.53.0 ומעלה, והוא תומך בשרתים כמו SGLang ו־vLLM עם פורמט תואם OpenAI.

הוא מתוכנן במקור לחלון הקשר של 65,536 טוקנים, ואפשר להרחיב אותו ל־128 אלף טוקנים בעזרת הגדרות YaRN בקובץ הקונפיגורציה. אם אתם צריכים רק משימות ניתוב פשוטות או עבודה מקומית על לפטופ בלי תלות ברשת, שווה להריץ אותו עצמאית. אם המטרה היא ניתוח של מסמכים ענקיים שדורשים תפוקה מהירה מאוד והקשר מלא, כרטיס מקומי חלש יתקשה בקצב הטוקנים וכדאי לשקול שרת ייעודי או שירות ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceTB/SmolLM3-3B")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון Apache 2.0, שזה רישיון קוד פתוח מתירני מאוד. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, להטמיע אותו במוצר סגור או להריץ אותו בענן פרטי. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗