GPT
S

stablelm-2-12b

קוד פתוח

stabilityaiother2024-03-21

  • transformers
  • safetensors
  • stablelm
  • text-generation
  • causal-lm

מודל בסיס רב-לשוני של 12 מיליארד פרמטרים שמתאים כנקודת מוצא לאימון והתאמה אישית. הוא מציע שילוב בין קוד, אנגלית ושפות אירופאיות מרכזיות במשקל שעדיין אפשר להחזיק על חומרה מקומית נגישה יחסית.

  • 12Bפרמטרים
  • 4,096טוקנים בהקשר
  • 22.6 GBמשקל הקבצים
  • 1,612הורדות בחודש

מה זה

מדובר במודל שפה מסוג decoder-only שאומן על שני טריליון טוקנים ממקורות מגוונים של טקסט חופשי וקוד, כולל מאגרים מוכרים כמו Falcon RefinedWeb, RedPajama, The Pile ו־StarCoder. הוא עבר שני מחזורי אימון מלאים בפורמט bfloat16 על גבי תשתית של 384 מעבדי H100, תוך שימוש בארכיטקטורה שכוללת נרמול שכבות מסוג LayerNorm ללא הטיות וסורק טוקנים מורחב בשם Arcade100k.

הייחוד שלו בקטגוריית הגודל הזו הוא ההרחבה לתמיכה במספר שפות אירופיות דרך דאטה מתוך CulturaX, לצד התמקדות ביכולות פיתוח בזכות שילוב נתונים מ־StarCoder. המבנה שלו מנצל הקשר של 4,096 טוקנים עם מנגנון Grouped-Query Attention שמיועד לחסוך בזיכרון בזמן הסקת מסקנות, מה שמציב אותו כבסיס יציב לפרויקטים שדורשים התאמה ייעודית ולא מענה שיחתי מוכן מהקופסה.

מתאים ל

  • פיין-טיונינג לכתיבת קוד

    הוא אומן על StarCoder ומהווה בסיס טוב להתאמה לכתיבת סקריפטים ובדיקות תוכנה.

  • בסיס למודל הוראות פרטי

    אימון ייעודי על נתונים פנימיים בארגון שדורש שליטה מלאה במשקולות ובחומרה.

  • עיבוד טקסט בשפות אירופיות

    האימון כלל שפות כמו גרמנית, צרפתית וספרדית מתוך CulturaX לצד אנגלית.

איפה זה נופל

זהו מודל בסיס שטרם עבר כיוונון להוראות או התאמת התנהגות, ולכן הוא לא יודע לשוחח ועלול לפלוט טקסט לא אמין, פוגעני או מקוטע אם לא תבצעו עליו פיין-טיונינג. בנוסף, חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, מה שמקשה על ניתוח מסמכים ארוכים, ואין בו שום תמיכה מובנית בעברית.

אותה משפחה

stablelm-2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כצ׳אטבוט?

לא, זהו מודל בסיס שממשיך טקסט בלבד ולא עבר אימון מסוג instruction tuning. אם תשאלו אותו שאלה, הוא ינסה להשלים את המשפט במקום לענות, ולכן חובה לאמן אותו קודם על שיחות.

האם הוא תומך בעברית?

המודל לא הוכשר על עברית ולא מיועד לכך לפי נתוני היצרן. רשימת השפות הרשמית כוללת אנגלית, גרמנית, ספרדית, צרפתית, איטלקית, הולנדית ופורטוגזית בלבד.

כמה זיכרון נדרש בפועל להרצה שלו?

בדיוק המקורי נדרשים לפחות 24 גיגה-בייט של VRAM בכרטיס המסך כדי לטעון את המשקולות ולהריץ טקסטים קצרים. אם תרצו לטעון אותו יחד עם הקשר מלא של 4,096 טוקנים, תזדקקו לכרטיס עם זיכרון רחב יותר או לשימוש בכימות.

איך מריצים

כדי להריץ אותו בפורמט המקורי של bfloat16 תצטרכו כרטיס מסך עם לפחות 24 גיגה-בייט של זיכרון ייעודי, כאשר קובצי המשקולות עצמם תופסים 22.6 גיגה-בייט באחסון. ההרצה נעשית ישירות דרך ספריית transformers מגרסה 4.40 ומעלה, ומומלץ להפעיל את Flash Attention 2 כדי לייעל את צריכת הזיכרון ומהירות הריצה.

אם אין לכם כרטיס תואם כמו RTX 3090 או A10G בסביבת ענן, תצטרכו לכווץ אותו או לשכור מכונה מתאימה לפי שעה. במקרים שבהם דרוש מודל שמגיב מיד כעוזר שיחה ולא תשתית לאימון עצמי, עדיף להשתמש במודל מכוונן מוכן דרך ספק צד שלישי ולא לתחזק תשתית כבדה כזו לבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="stabilityai/stablelm-2-12b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת Stability AI Community License, ולא כקוד פתוח חופשי לחלוטין. הוא מחייב פנייה ישירה לחברה והסדרת רישיון מסחרי נפרד אם אתם מתכננים לשלב אותו בתוך מוצר רווחי או להפיץ אותו ללקוחות.

הרישיון המלא בעמוד המודל ↗