GPT
S

SmallThinker-21BA3B-Instruct

קוד פתוח

Tiinyapache-2.02025-07-26

  • transformers
  • safetensors
  • moe
  • text-generation
  • en

מודל מומחים של 21 מיליארד פרמטרים שמפעיל רק 3 מיליארד בכל מילה. הוא נבנה במיוחד כדי לרוץ מהר על מעבדים שולחניים בלי לקרוס תחת מחסור בזיכרון.

  • 22Bפרמטרים
  • 40.1 GBמשקל הקבצים
  • 281הורדות בחודש
  • 113לייקים

מה זה

הארכיטקטורה כאן מחלקת 21 מיליארד פרמטרים בין 64 מומחים שונים, כאשר בכל שלב נבחרים רק שישה. הרעיון המרכזי בפיתוח הוא התאמה מראש למגבלות של חומרה מקומית, כמו זיכרון מוגבל ונפח אחסון אטי, במקום לכווץ בדיעבד מודל ענק שנבנה לשרתים.

במדדי ביצועים הוא עומד על ממוצע של 76.26 נקודות, ועוקף מודלים מוכרים מקבילים כמו Qwen3-14B ו־Phi-4-14B. בבדיקות של כתיבת קוד ב־HUMANEVAL הוא מגיע ל־89.63, ובמענה לשאלות מורכבות ב־GPQA-diamond הוא עומד על 55.05. המספרים האלה מראים שהוא שומר על רמת דיוק של מודלים צפופים גדולים, למרות שהוא דורש חישוב של 3 מיליארד פרמטרים בלבד בזמן יצירת הטקסט.

מתאים ל

  • עוזר פיתוח מקומי

    ציון של 89.63 ב־HUMANEVAL מאפשר השלמת קוד ישירות על מעבד המחשב בלי לשלוח מידע לרשת.

  • עיבוד טקסט באנגלית בנתק

    מתאים לניתוח ומענה על טקסטים באנגלית בסביבות ללא אינטרנט או תחת הגבלות פרטיות.

  • יישומי קצה על חומרה רזה

    בגרסת Q4_0 הוא דורש 8 גיגה בייט זיכרון בלבד ומאפשר אינטראקציה סבירה בלי מאיץ גרפי ייעודי.

איפה זה נופל

היוצרים מציינים במפורש שהאימון התמקד בעיקר באנגלית. לא מדווח כאן שום אימון ייעודי לעברית, ולכן פניות בעברית צפויות להניב תוצאות חלשות, שגיאות דקדוקיות או חוסר הבנה מוחלט. בנוסף, חלון ההקשר מוגבל ל־16K בלבד, מה שלא מתאים למסמכים ארוכים מאוד. כרטיס המודל מזהיר מפני מידע לא מדויק, הטיות ומידע ישן שנבעו ממגבלות נתוני האימון.

אותה משפחה

SmallThinker-21BA3B יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה שוטפת בעברית?

לא כדאי לבנות על זה. כרטיס המודל מדגיש שהאימון נעשה בעיקר על אנגלית, ואין נתונים על תמיכה בשפות אחרות. סביר להניח שכל משימה בעברית תיתקל בקשיים מהותיים.

אפשר להריץ אותו בלי כרטיס מסך של אנבידיה?

כן, לשם כך הוא תוכנן. בשימוש בקוונטיזציה של Q4_0 דרך מנוע PowerInfer, מעבד מחשב סטנדרטי מסוגל להפיק מעל 20 טוקנים לשנייה תוך צריכת 8 גיגה בייט זיכרון בלבד.

איך מריצים

המשקל המקורי של הקבצים תופס 40.1 גיגה בייט, כך שהרצה ישירה בפורמט bfloat16 עם ספריית transformers דורשת כרטיס מסך חזק וגרסה ספציפית מאוד, transformers 4.53.3, לצד הרשאת trust_remote_code. אם אתם רוצים פשוט לשלוח שאילתות בלי לנהל תלויות קוד וספריות ייעודיות, עדיף לפנות ל־API חיצוני.

המטרה העיקרית של המודל היא דווקא הרצה מכווצת בקוונטיזציה של Q4_0 דרך מנוע PowerInfer. בתצורה הזו, גם תחת הגבלת זיכרון של 8 גיגה בייט, מעבד כמו i9 14900 מפיק 20.30 טוקנים לשנייה, ומעבד נייד 8ge4 מגיע ל־15.50 טוקנים לשנייה בארבעה תהליכונים. על חומרה חלשה יותר כמו Raspberry PI 5 הקצב יורד ל־6.61 טוקנים לשנייה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Tiiny/SmallThinker-21BA3B-Instruct")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית בתוך מוצרים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, בלי חובת פתיחת קוד המקור שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗