GPT
S

Supra-Router-51M

קוד פתוח

SupraLabsרישיון לא דווח2026-07-05

  • transformers
  • safetensors
  • llama
  • text-generation
  • router

זה נתב בקשות זעיר שמחליט אם לשלוח פרומפט למודל מקומי קטן או לשרת בענן. הוא שוקל בקושי מאה מגה בייט ומחזיר ניתוח מובנה תוך שבריר שניה.

  • 52Mפרמטרים
  • 5,120טוקנים בהקשר
  • 101 MBמשקל הקבצים
  • 1,965הורדות בחודש

מה זה

במקום לתת למודל ענק לענות על כל שאלה פשוטה ולשרוף כסף, שמים את הדבר הזה בכניסה למערכת. הוא מקבל את הפרומפט ופולט מחרוזת מובנית שמפרקת את התחום, רמת הסיבוכיות מ־1 עד 5, האם יש שם קוד או מתמטיקה, לאן לנתב והסבר קצר. הרעיון הוא לגרום למודל קטנטן לבצע שלבי חשיבה בטקסט לפני ההכרעה הסופית, מה שמונע קריסה של קבלת ההחלטות.

הוא אומן על דאטה־סט זעיר של 992 שורות בלבד במשך חמישה סבבים, כשהגרסה שנבחרה נעצרה בסבב השלישי עם הפסד אימות של 0.1342 כדי למנוע שינון עיוור. הבדיקות של היוצרים מראות שהוא יודע להבדיל בין מילים מטעות, כמו המילה תסריט שלא תקפוץ ישר לקטגוריית תכנות, אבל הבסיס עליו הוא למד צר מאוד.

מתאים ל

  • שער חכם לניתוב פרומפטים

    הוא מזהה מתי שאילתה פשוטה יכולה לרוץ על מעבד מקומי ומתי חובה לשלוח אותה למודל ענן יקר.

  • סינון קלט למכשירי קצה

    המשקל הזעיר מאפשר להריץ אותו מקומית על לפטופ או חומרת קצה בלי תלות ברשת ובלי צריכת זיכרון.

  • תיוג ראשוני לשאילתות

    הפלט המובנה מספק סיווג אוטומטי של מורכבות, תחום סמנטי ונוכחות של קוד או מתמטיקה בטקסט.

איפה זה נופל

האימון התבסס על 992 דוגמאות בלבד באנגלית. אם תזרקו עליו פרומפטים בעברית או מבנה בקשה מורכב שלא נכלל בדאטה המקורי, הוא עלול להיכשל בחלוקה הבסיסית או לפלוט פורמט שבור שיפיל את הקוד שלכם. בנוסף, כל החלטת הניתוב שלו בינארית לחלוטין, בין מודל קטן למודל גדול, כך שאם יש לכם כמה שכבות עיבוד או יותר משני יעדים, תצטרכו לכתוב את כל שכבת ההיגיון הזו בעצמכם.

שאלות
נפוצות

אפשר להשתמש בו לניתוב טקסטים בעברית?

לא מומלץ. המודל הוגדר ואומן באנגלית בלבד על פחות מאלף דוגמאות, והוא צפוי לפספס את הניתוח הסמנטי או לשבור את הפורמט בטקסט מקומי.

הוא יכול להחליף מודל סיווג רגיל או מודל שפה גדול?

הוא לא עונה על שאלות ולא מנהל שיחה, אלא רק מייצר מחרוזת טלמטריה טכנית שמיועדת לקריאה על ידי קוד במערכת שלכם.

איך מריצים

עם משקל כולל של 101 מגה בייט וארכיטקטורת Llama רגילה, אפשר לטעון אותו ישירות דרך ספריית transformers בזיכרון של כל מחשב, טלפון או מעבד שרת פשוט בלי לגעת בכרטיס מסך ייעודי. קיימת גם גרסת GGUF למי שמעדיף להריץ אותו דרך מנועים מקומיים קלים. אין שום סיבה בעולם לפנות ל־API חיצוני בשביל מודל כזה, כי העלות החישובית שלו אפסית והמטרה כולה היא לחסוך קריאות רשת איטיות ויקרות.

בזמן ההרצה חובה להשתמש בדגימה חמדנית, כלומר do_sample=False, ולעטוף את הפרומפט בדיוק בתבנית שהוא מכיר עם Task בהתחלה ו־Analysis בסוף. החומרה לא תרגיש אותו, ואורך הרצף המומלץ מוגדר עד 3,840 טוקנים כדי לשמור על זמני תגובה של פחות ממילישנייה.

from transformers import pipeline

pipe = pipeline("text-generation", model="SupraLabs/Supra-Router-51M")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 101 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא פרסמו רישיון עבור המודל. מבחינה משפטית זה אומר שאין לכם היתר מפורש להשתמש בו, להפיץ אותו או לשלב אותו במוצר מסחרי, וכל שימוש כזה חושף אתכם לסיכון עד שהם יעדכנו תנאי שימוש ברורים.

הרישיון המלא בעמוד המודל ↗