GPT
S

SmolLM3-3B-128K-GGUF

קוד פתוח

unslothapache-2.02025-07-08

  • transformers
  • gguf
  • unsloth
  • en
  • fr

גרסת GGUF מכווצת למודל קומפקטי שמגיע עם תמיכה מובנית בחלון הקשר ענקי, חשיבה מורכבת והפעלת כלים. הפתרון מיועד למי שצריך מודל חכם אך קל שיכול לרוץ מקומית בלי תלות ברשת.

  • 46.6 GBמשקל הקבצים
  • 2,773הורדות בחודש
  • 46לייקים

מה זה

המודל הזה מבוסס על ארכיטקטורת דקודר של 3 מיליארד פרמטרים, ואומן על 11 טריליון טוקנים יחד עם 140 מיליארד טוקנים ייעודיים לחשיבה מתמטית ולוגית. הוא כולל תמיכה מובנית בחלון הקשר של עד 128 אלף טוקנים באמצעות הרחבת YaRN, ומאפשר מעבר בין מענה ישיר למצב חשיבה מעמיק דרך פקודות מערכת כמו think ו־no_think.

במבחני ביצועים מול דגמים דומים בקטגוריה, הוא בולט במיוחד במעקב אחר הוראות מורכבות עם ציון IFEval של 76.7, ובקריאה לפונקציות וכלים שבהם השיג 92.3 במבחן BFCL. עם זאת, בקידוד תחרותי הוא משיג 15.2 בלבד ב־LiveCodeBench ללא חשיבה מורחבת, כך שביצועי הפיתוח שלו נשארים מוגבלים לעומת מודלים גדולים יותר.

מתאים ל

  • הפעלת כלים ואוטומציה מקומית

    מתאים לחיבור לפונקציות JSON וסקריפטים של פייתון בזכות ציון של 92.3 במבחן BFCL.

  • ניתוח טקסטים ארוכים באנגלית

    מסוגל לקרוא מסמכים גדולים על חומרה צנועה בזכות חלון הקשר של 128 אלף טוקנים.

  • פתרון בעיות לוגיות במכשיר קצה

    מצב החשיבה המורחב מקפיץ את התוצאות במתמטיקה מורכבת מבלי לדרוש חיבור רשת.

איפה זה נופל

המודל עלול לייצר מידע שאינו מדויק עובדתית, חוסר עקביות לוגית או הטיות שמקורן בנתוני האימון. הוא אינו מיועד לשמש כמקור מידע בלעדי ללא בדיקה של התוצרים.

מבחינת שפות, המודל אומן באופן מלא רק על אנגלית, צרפתית, ספרדית, גרמנית, איטלקית ופורטוגזית. עברית אינה מופיעה ברשימת השפות הנתמכות שלו, ואפילו בשפות עם תמיכה חלקית כמו ערבית, סינית ורוסית הביצועים נמוכים משמעותית, ולכן הוא אינו מתאים לעיבוד טקסט בעברית.

שאלות
נפוצות

האם המודל מסוגל לעבוד בעברית?

לא. נתוני האימון כללו בעיקר שש שפות אירופיות, לצד מעט ערבית, רוסית וסינית. עברית כלל אינה נתמכת, והוא לא יתאים למשימות בעברית.

איך שולטים במצב החשיבה המורחב של המודל?

אפשר להעביר את הפקודה think או no_think בתוך פרומפט המערכת כדי לקבוע אם המודל יציג את שלבי המחשבה שלו. בנוסף, בספריות פיתוח תואמות ניתן להגדיר את המשתנה enable_thinking ישירות בפרמטרי השיחה.

מה צריך כדי להריץ את קובצי ה־GGUF האלה?

אפשר להשתמש במנועים כמו llama.cpp או מנועי הסקה דומים במחשב אישי. כאשר עובדים עם llama.cpp, יש להקפיד להפעיל את הדגל jinja כדי שתבנית השיחה והוראות המערכת יפעלו בצורה תקינה.

איך מריצים

כדי להריץ את קובצי ה־GGUF מקומית, משתמשים בכלים כמו llama.cpp, שבהם יש להפעיל את הדגל jinja כדי לתמוך בפרומפט המערכת. מודל בגודל 3 מיליארד פרמטרים שוקל בדרך כלל בין 2 ל־4 גיגה בייט בכימוס סביר, ולכן אפשר להריץ אותו בקלות על מעבד מחשב נייד מודרני או על כרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון וידאו.

אם אתם מתכננים להעמיס עליו את מלוא 128 אלף הטוקנים של חלון ההקשר, צריכת זיכרון ה־RAM וזיכרון הווידאו תקפוץ משמעותית בגלל טבלאות ה־KV. במקרים שבהם צריך לנתח מסמכים ענקיים באופן תדיר או לייצר תפוקה במקביל למשתמשים רבים, עדיף לפנות לשרת ייעודי דרך vLLM או לשירות ענן מאשר לנסות להחזיק את כל ההקשר בחומרה מקומית חלשה.

ollama run hf.co/unsloth/SmolLM3-3B-128K-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש חופשי לחלוטין לצרכים אישיים ומסחריים כאחד. מותר להריץ, לשנות, להפיץ ולשלב אותו במוצרים מסחריים סגורים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי בקוד או במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗