GPT
S

Supra-50M-Base

קוד פתוח

SupraLabsapache-2.02026-05-21

  • transformers
  • safetensors
  • llama
  • text-generation
  • supra

מודל בסיס זעיר של 52 מיליון פרמטרים שרץ על כל מעבד קיים. הוא מיועד למי שמחפש נקודת התחלה קלילה לאימון המשך או משימות סיווג באנגלית בלי לגעת בשרתים יקרים.

  • 52Mפרמטרים
  • 1,024טוקנים בהקשר
  • 200 MBמשקל הקבצים
  • 1,746הורדות בחודש

מה זה

מדובר במודל שפה מסוג Llama decoder-only שאומן מאפס על 20 מיליארד טוקנים מתוך מאגר fineweb-edu. גודל כזה נדיר בנוף הנוכחי, שבו כמעט הכל מתחיל ממיליארד פרמטרים ומעלה, והוא מציע חלופה קומפקטית מאוד למודלים ותיקים כמו GPT-2 של 124 מיליון פרמטרים.

במבחני ביצועים הוא עוקף את GPT-2 בחלק מהמדדים, למשל 76.3% במבחן הלשוני BLiMP לעומת 63%, וציון של 52.2% ב־ARC-Easy לעומת 42%. מול מודלים קצת יותר גדולים ומודרניים כמו OpenELM או SmolLM הוא כבר מאבד גובה, בייחוד במבחני הבנת הקשר והיגיון כמו HellaSwag, שבו הוא עומד על 31.8% בלבד. זה אומר שהוא שולט במבנה תחבירי בסיסי באנגלית, אבל מתקשה להחזיק רצף הגיוני מורכב.

מתאים ל

  • בסיס למודל סיווג ייעודי

    אימון נוסף עם מעט נתונים כדי למיין טקסטים קצרים באנגלית, בזיכרון מזערי ובעלות חישוב אפסית.

  • הרצה מקומית על מכשירי קצה

    השלמת טקסט בסיסית בחומרה חלשה מאוד או במכשירים מנותקי רשת שלא יכולים להחזיק מודלים כבדים.

  • מחקר והוראה בתחום שפה

    ניסויי ארכיטקטורה ואימון מהירים מאפס בלי לשרוף תקציבי ענן גדולים על משאבי מחשוב.

איפה זה נופל

זהו מודל בסיס ולא מודל שעבר התאמה לשיחה או להוראות, ולכן פקודות ישירות יניבו השלמת טקסט ולא מענה ענייני. דוגמאות הפלט של היוצרים עצמם מראות שהוא נוטה לפלוט הזיות מוזרות, משפטים שמתחילים במילים כמו iffy בלי קשר, וקפיצות פתאומיות בין נושאים. חלון ההקשר מוגבל ל־1,024 טוקנים בלבד, והוא אומן על אנגלית בלבד, כך שאין מה לנסות להריץ עליו טקסטים בעברית.

אותה משפחה

Supra יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש בו כמו בצ'אטבוט?

לא. זה מודל בסיס שנועד לנחש את הטוקן הבא, לא לענות על שאלות. אם תכתבו לו שאלה, הוא עשוי להמשיך אותה בשאלה נוספת או לקפוץ לנושא לא קשור במקום להשיב.

הוא יודע לעבוד בעברית?

המודל אומן על קורפוס אינטרנט לימודי באנגלית עם מילון ייעודי שנבנה עבורו. אין לו תמיכה מובנית בעברית, והוא לא ייצר טקסט עברי הגיוני.

איך מריצים

אין שום סיבה לשלם על API או להחזיק שרת ייעודי בשביל מודל כזה. כל הקבצים שוקלים יחד 200 מגה-בייט, והוא נטען ישירות דרך ספריית transformers בפייתון בשורה אחת של קוד pipeline.

הוא רץ בלי בעיה על מעבד פשוט של מחשב נייד, בזיכרון RAM זניח של כמה מאות מגה-בייט, ומתאים מאוד להרצה מקומית על מכשירי קצה. אם המטרה היא לקבל תשובות אינטליגנטיות לשאלות משתמשים, עדיף לפנות ל־API חיצוני, כי המודל הזה לא מיועד לצ'אט אלא להשלמת טקסט גולמית.

from transformers import pipeline

pipe = pipeline("text-generation", model="SupraLabs/Supra-50M-Base")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו גרסאות המשך ולהפיץ אותו בתוך מוצר סגור, בלי לשלם תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗