GPT
S

Supra2-100M-Instruct

קוד פתוח

SupraLabsapache-2.02026-08-03

  • transformers
  • safetensors
  • gguf
  • qwen3
  • text-generation

מודל שיחה זעיר בארכיטקטורת Qwen3 שאומן מאפס על שלושים מיליארד טוקנים. הוא שוקל 580 מגה בייט ומתאים בעיקר למי שרוצה לחקור מודלים קטנים על חומרה בסיסית.

  • 101Mפרמטרים
  • 2,048טוקנים בהקשר
  • 580 MBמשקל הקבצים
  • 14,983הורדות בחודש

מה זה

SupraLabs בנו כאן מודל של 101 מיליון פרמטרים בלבד, שזה גודל שכמעט נעלם מהנוף של מודלי שפה מודרניים. הוא אומן מאפס על טקסט רשת באנגלית ועבר כוונון להוראות על כשלוש מאות מיליון טוקנים, שרובם מגיעים ממאגר smol-smoltalk ומעט מתמטיקה בסיסית. הוא משתמש במבנה של Qwen3 עם אוצר מילים ייעודי של 32,768 טוקנים ותבנית ChatML.

המודל מיועד לשיחה בסיסית מאוד, בדיקות ארכיטקטורה ומחקר של התנהגות מודלים קטנים. אין כאן טבלת ציונים רשמית, אבל הדוגמאות שהיוצרים עצמם צירפו חושפות את המצב האמיתי. הוא ממציא עובדות היסטוריות ברמה מביכה, למשל שהמתקפה על פרל הארבור קרתה ב־2001, ומערבב מושגים בצורה אקראית כששואלים אותו על ניתוח תנועה ברשת או אפילו על פאסט פוד.

מתאים ל

  • ניסויי אימון מקומיים

    הגודל הזעיר מאפשר לבצע כוונון מלא במהירות ובזול על כרטיס מסך ביתי בודד.

  • בדיקת תהליכי פיתוח

    משקל של 580 מגה בייט מתאים להרצה מהירה של בדיקות אינטגרציה ותשתיות שיחה.

  • מחקר על מודלים קטנים

    בדיקת התנהגות שפה ויכולות שיחה בסיסיות בהיקף של 100 מיליון פרמטרים.

איפה זה נופל

המודל חלש מאוד בשמירה על עובדות, בהיגיון ובפתרון בעיות, והוא סובל מהזיות כבדות וסטיות מהנושא כבר אחרי כמה משפטים. למרות שההגדרה מאפשרת חלון של 2,048 טוקנים, האימון עצמו בוצע על 1,024 טוקנים בלבד, ולכן הרחבה מעבר לזה לא נבדקה וצפויה להידרדר. בנוסף, האימון נעשה ללא הפרדת מסמכים באריזת הטקסט, מה שפוגע בעקביות, והוא תומך אך ורק באנגלית ולא אומן על עברית כלל.

שאלות
נפוצות

האם אפשר להשתמש בו בעברית?

לא. המודל אומן אך ורק על טקסט באנגלית, ובכרטיס המודל מצוין במפורש שאינו תומך בשפות אחרות.

האם הוא מתאים לשימוש מול לקוחות באפליקציה?

ממש לא. המפתחים הגדירו אותו כלא מתאים לסביבת ייצור, ומבחני הדוגמה מראים שהוא ממציא נתונים ומאבד עקביות בקלות.

איזה חומרה מינימלית צריך כדי לנסות אותו?

כל מחשב אישי מודרני יכול להריץ אותו על המעבד או על כרטיס מסך פשוט, שכן כל המשקלים שלו תופסים פחות מגיגה זיכרון.

איך מריצים

במשקל של 580 מגה בייט בלבד, המודל הזה רץ כמעט על כל דבר. לא צריך שרת ולא צריך ענן יקר, כרטיס מסך ביתי ישן או אפילו מעבד רגיל יספיקו כדי להריץ אותו דרך ספריית transformers. את הכוונון המלא שלו המפתחים עשו על כרטיס יחיד מסוג RTX 5060 Ti עם 16 גיגה זיכרון.

אם אתם שוקלים להשתמש בו ליישום אמיתי, עדיף לפנות לכל ממשק API קיים של מודל גדול. אין שום היגיון הנדסי להריץ מודל של 100 מיליון פרמטרים עבור משתמשי קצה כשאפילו המודלים הקטנים והזולים בענן יתנו תוצאות טובות פי כמה. ההרצה המקומית שלו מוצדקת רק לצורכי מחקר, לימוד או ניסויי אימון מקומיים.

ollama run hf.co/SupraLabs/Supra2-100M-Instruct:F16

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש, בלי דרישה לפתוח את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗