GPT
S

steerling-8b

קוד פתוח

guidelabsapache-2.02026-02-22

  • steerling
  • safetensors
  • causal-diffusion
  • interpretability
  • concept-steering

מודל שפה של 8.4 מיליארד פרמטרים שמייצר טקסט בדיפיוזיה במקום חיזוי המילה הבאה. הוא מפרק את המצבים הפנימיים למושגים ברורים שמאפשרים לחקור ולכוון את ההתנהגות שלו.

  • 8.4Bפרמטרים
  • 15.6 GBמשקל הקבצים
  • 378הורדות בחודש
  • 118לייקים

מה זה

במקום המבנה הרגיל שרץ טוקן אחרי טוקן משמאל לימין, כאן מדובר במודל דיפיוזיה שחושף טוקנים לפי רמת הוודאות שלו בבלוקים של שישים וארבעה טוקנים. תשומת הלב הפנימית היא דו-כיוונית בתוך כל בלוק וסיבתית בין הבלוקים השונים. ארכיטקטורת SteerlingForCausalLM משלבת ראשי מושגים שמפרקים את הוקטורים הפנימיים ל־33,732 מושגים ידועים שניתן לפענח ולכוון, לצד עשרות אלפי מושגים לא ידועים ושארית לתיקון דיוק.

האימון שלו נשען על Nemotron-CC-HQ ועל מאגר Dolmino Mix למתמטיקה. הכרטיס לא מציג תוצאות מבחנים סטנדרטיים, כך שאי אפשר לדעת מראש איך הוא מתפקד בהשוואה למודלי שמונה מיליארד מקבילים במשימות ידע כללי או קוד. הערך העיקרי כאן הוא לא עוד מנוע גנרטיבי רגיל, אלא היכולת לפתוח את הקופסה השחורה ולשלוט ישירות במושגים הפנימיים בזמן הריצה.

מתאים ל

  • מחקר יכולת פרשנות של מודלים

    הארכיטקטורה מפרקת את המצבים הפנימיים לעשרות אלפי מושגים מוגדרים שניתן לחקור ישירות.

  • הכוונת תוכן ברמת המושג

    שליטה ידנית במשקולות של תכונות ידועות בזמן יצירת הטקסט ללא צורך באימון מחדש.

  • בדיקת גישות דיפיוזיה לטקסט

    התנסות מעשית ביצירת טקסט שלא נשענת על חיזוי טוקנים עוקב רגיל.

איפה זה נופל

הוא מוגבל לאנגלית בלבד עם חלון הקשר קצר של 4,096 טוקנים, מה שלא מתאים לטקסטים ארוכים או מסמכים שלמים. מעבר לזה, הכרטיס מציין במפורש שהדאטהסט Nemotron-CC כולל תוכן סינתטי שנוצר במודלים כמו Qwen ו־DeepSeek, מה שעלול לייצר השפעות של מודלי מקור אחרים על הפלט.

שאלות
נפוצות

אפשר להריץ אותו דרך ספריית transformers הרגילה?

לא. המודל דורש ארכיטקטורה משלו ומחייב התקנה של ספריית steerling הייעודית. הקריאה מתבצעת ישירות דרך SteerlingGenerator ולא בעזרת הכלים הרגילים של האגינג פייס.

האם המודל מבין או מייצר עברית?

הוא מוגדר לשפה האנגלית בלבד. המילון ונתוני האימון מכוונים לאנגלית ולמתמטיקה, ולכן הוא לא יתאים למשימות בעברית.

האם אפשר להשתמש בו במוצר מסחרי?

הקוד תחת אפאצ'י 2.0, אבל החברה שמפתחת אותו מציינת במפורש שמעמד המשקלים לשימוש מסחרי עדיין נבדק מול תנאי הדאטהסטים. לצורך מוצר מסחרי הם מבקשים לפנות אליהם ישירות במייל.

איך מריצים

כדי להריץ אותו צריך להתקין את הספרייה הייעודית steerling מפייפון ולקרוא לקוד ישירות דרך SteerlingGenerator. הקבצים שוקלים 15.6 גיגה-בייט והמודל דורש בערך 18 גיגה-בייט של זיכרון גרפי בגלל דיוק bfloat16, כך שכרטיס עם 16 גיגה-בייט או פחות לא יספיק בכלל.

כרטיסי RTX 3090 או 4090 של 24 גיגה-בייט ומעלה, או כרטיסי A100 ו־A6000, יעבדו בלי בעיה מקומית. אין כאן אפשרויות קוונטיזציה מוכנות מראש להורדה ואין גרסאות מוקטנות, אז אם אין לכם חומרה ייעודית עם זיכרון מספק, תצטרכו להרים שרת ענן ייעודי בעצמכם.

pip install -U huggingface_hub
hf download guidelabs/steerling-8b

הרישיון

הקוד והמשקלים פורסמו תחת רישיון אפאצ'י 2.0, אבל המפתחים מציינים שהמשקלים נועדו למחקר ולהערכה וממליצים ליצור איתם קשר לגבי שימוש מסחרי. הסיבה היא נתוני האימון, שמגיעים מהסכמי שימוש של אנבידיה וכוללים טקסט סינתטי ממודלים של צד שלישי, כך שההשלכות המשפטיות על המוצר שלכם עדיין בבדיקה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗