GPT
S

SmolLM3-3B-GGUF

קוד פתוח

ggml-orgapache-2.02025-07-08

  • gguf
  • en
  • fr
  • es
  • it

גרסת GGUF למודל קומפקטי שמכוון לחשיבה לוגית מעמיקה והקשר ארוך במיוחד. הוא מיועד למי שצריך להריץ מודל חכם מקומית בלי לרוקן את משאבי הזיכרון.

  • 10.6 GBמשקל הקבצים
  • 9,068הורדות בחודש
  • 69לייקים

מה זה

מדובר במודל שפת קוד פתוח עם שלושה מיליארד פרמטרים, שאומן מראש על 11.2 טריליון טוקנים ועבר כוונון ייעודי לחשיבה מורכבת. בניגוד לרוב המודלים בגודל הזה, הוא מגיע עם תמיכה מובנית בחלון הקשר של עד 128 אלף טוקנים באמצעות אקסטרפולציית YARN, ומציג יכולת חשיבה מורחבת שאפשר להפעיל בעזרת דגל jinja. השפות העיקריות בו הן אנגלית, צרפתית, ספרדית, גרמנית, איטלקית ופורטוגזית, לצד אימון מוגבל יותר בערבית, סינית ורוסית. עברית לא נכללת ברשימת השפות הנתמכות.

במבחני הביצועים רואים תמונה מעניינת. במצב חשיבה מורחבת, המודל מזנק מציון של 9.3 ל־36.7 במבחן המתמטי AIME 2025, ומכפיל את התוצאה שלו ב־LiveCodeBench ל־30.0 נקודות. בהשוואה למודלים אחרים בקטגוריית 3B, הוא מנצח את רובם בהבנת הנקרא ובמשימות היגיון, אך עדיין מפגר מאחורי מודלים מעט גדולים יותר כמו Qwen3 של ארבעה מיליארד פרמטרים, במיוחד במשימות קידוד טהור.

מתאים ל

  • הסקה לוגית מקומית

    מצב החשיבה המורחבת מספק ביצועים גבוהים במתמטיקה ופתרון בעיות על גבי מחשב אישי.

  • ניתוח מסמכים ארוכים

    תמיכה בחלון הקשר של עד 128 אלף טוקנים מאפשרת לעבד טקסטים ארוכים בלי לחתוך מידע.

  • מערכות משובצות קלות

    גודל של 3 מיליארד פרמטרים שרץ על חומרה בסיסית במסגרת פרויקטים פנימיים ואופליין.

איפה זה נופל

יוצרי המודל מציינים בפירוש שהפלט עלול לכלול אי־דיוקים עובדתיים, כשלים לוגיים והטיות שמקורן בנתוני האימון. הוא לא מתאים לשמש כמקור מידע מוחלט אלא ככלי עזר בלבד שדורש בדיקה. בנוסף, מחוץ לשש השפות האירופיות המרכזיות, הביצועים שלו בערבית, סינית ורוסית נמוכים בהרבה, ומכיוון שעברית כלל אינה מוזכרת, לא הייתי בונה עליו לפרויקטים מקומיים בעברית.

שאלות
נפוצות

איך מפעילים את מנגנון החשיבה של המודל?

בזמן ההרצה דרך llama.cpp חובה להעביר את הפרמטר jinja בפקודה. בלי הדגל הזה, המודל יעבוד במצב instruct רגיל ולא ישתמש בשרשרת החשיבה שמביאה את עיקר השיפור בציונים.

האם המודל מתאים לעבודה בעברית?

הוא לא אומן רשמית על עברית, והתיעוד מציין תמיכה בשש שפות מערביות לצד נתונים מועטים בערבית, סינית ורוסית בלבד. לא כדאי להסתמך עליו לפרויקטים שדורשים שליטה בשפה העברית.

איך מריצים

את קובצי ה־GGUF אפשר להריץ מיד בעזרת llama.cpp דרך שורת הפקודה, וחשוב להוסיף את הדגל jinja אם רוצים לקבל את יכולות החשיבה המורחבת. כלל הקבצים שוקלים 10.6 גיגה בייט ומחולקים לחמישה קבצים, כך שאין בעיה להריץ אותם על מעבד גרפי צנוע, מעבד M של אפל או אפילו על זיכרון RAM סטנדרטי של מחשב נייד מודרני.

אם התשתית שלכם דורשת שרת ייעודי, המודל עובד ישירות גם מול ספריות כמו vllm ו־transformers. אם אתם צריכים תפוקה גבוהה של טוקנים לעשרות משתמשים במקביל ולא רוצים לנהל שרתים וחומרה מקומית, עדיף לפנות ל־API מנוהל שמחזיק מודלים גדולים יותר.

ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

5 קבצים במאגר, 10.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני לחלוטין, שמאפשר שימוש מסחרי, שינוי של המשקלים, הפצה ושילוב בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗