GPT
S

SmallThinker-21BA3B-Instruct-GGUF

קוד פתוח

Tiinyapache-2.02025-07-27

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • conversational

מודל מומחים מקומי שמפעיל רק 3 מיליארד פרמטרים מתוך 21 בזמן ריצה. הוא נבנה במיוחד למכשירים מוגבלי חומרה שצריכים ביצועים חזקים בלי לפנות לענן.

  • 356 GBמשקל הקבצים
  • 2,216הורדות בחודש
  • 39לייקים

מה זה

מדובר בארכיטקטורת MoE הכוללת 64 מומחים, שמתוכם נבחרים 6 בכל טוקן, כך שבפועל מופעלים כ־3 מיליארד פרמטרים בלבד מתוך 21 מיליארד. התוצאה היא מודל שיודע לתת רמת דיוק גבוהה של מודל גדול בהרבה, אבל דורש משאבי חישוב של מודל קל משקל.

במבחני הביצועים הוא מציג ממוצע של 76.26 נקודות, ועוקף מודלים כמו Gemma3 בגרסת 12B ו־Qwen3 בגרסאות 14B ו־30B במצב ללא חשיבה. ב־HumanEval הוא מגיע ל־89.63 נקודות וב־IFEVAL ל־85.77, מה שמעיד על הבנה חזקה של קוד ויכולת גבוהה לעקוב אחרי הוראות מורכבות.

מתאים ל

  • פיתוח קוד מקומי

    מתאים לפתרון בעיות תכנות על המחשב האישי בלי תלות ברשת, בזכות ציון של 89.63 ב־HumanEval.

  • הרצה על חומרת קצה

    רץ ישירות על מעבדי מכשירים ניידים ומחשבים קטנים כמו Raspberry Pi 5 בצריכת זיכרון מוגבלת ל־8 גיגה-בייט.

  • ציות מדויק להנחיות

    מתאים למשימות אוטומציה מבוססות טקסט הדורשות מעקב קפדני אחר פורמט, בזכות תוצאה של 85.77 ב־IFEVAL.

איפה זה נופל

המודל אומן בעיקר על אנגלית, ולכן לא מתאים למשימות הדורשות עברית טבעית או שפות אחרות. חלון ההקשר שלו מוגבל ל־16K טוקנים בלבד, כך שהוא לא יספיק לניתוח מסמכים ארוכים מאוד או בסיסי קוד גדולים. בנוסף, המפתחים מדגישים שהתשובות עלולות להכיל אי דיוקים עובדתיים, הטיות או מידע מיושן שדורשים בדיקה ידנית לפני שילוב בייצור.

אותה משפחה

SmallThinker-21BA3B יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

באיזו גרסת קובץ כדאי לבחור להרצה מקומית?

אם אתם עובדים עם llama.cpp רגיל, חובה להוריד את הקבצים עם סיומת gguf הסטנדרטית. קבצים המסתיימים ב־powerinfer.gguf כוללים אופטימיזציות מיוחדות לשכבות הדלילות, והם יעבדו רק אם תריצו אותם דרך ספריית PowerInfer.

האם המודל מתאים לשימוש בעברית?

הכרטיס מציין במפורש שהאימון בוצע בעיקר על אנגלית. אין במפרט עדות לתמיכה מספקת בעברית, ולכן לא מומלץ להסתמך עליו למשימות בשפה זו.

איך מריצים

המודל מופץ בשתי גרסאות GGUF שונות. קבצים עם סיומת gguf רגילה מיועדים להרצה ישירה דרך llama.cpp, ואילו קבצים עם סיומת powerinfer.gguf כוללים אופרטורים מותאמים ודורשים את התשתית של PowerInfer כדי להשיג את מהירות הריצה המרבית.

מבחינת חומרה, בגרסת q4_0 נדרשים כ־11.47 גיגה-בייט של זיכרון, אך ניתן להגביל אותו גם ל־8 גיגה-בייט. על מעבד i9 הוא מפיק סביב 30 טוקנים לשנייה, ועל מחשבי קצה כמו Raspberry Pi 5 הוא רץ בקצב של כ־6.6 טוקנים לשנייה. אם אין לכם חומרה ייעודית מקומית עם לפחות 8 עד 12 גיגה-בייט זיכרון פנוי, עדיף להשתמש במודל ענן דרך API.

ollama run hf.co/Tiiny/SmallThinker-21BA3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗