GPT
S

stablelm-zephyr-3b

קוד פתוח

stabilityaiother2023-11-21

  • transformers
  • safetensors
  • stablelm
  • text-generation
  • causal-lm

מודל שיחה קומפקטי שמביא יכולות מעקב אחרי הוראות לחומרה מקומית וצנועה. הוא מתאים למי שחייב להריץ מודל על כרטיס מסך בסיסי בלי לחנוק את הזיכרון.

  • 2.8Bפרמטרים
  • 4,096טוקנים בהקשר
  • 5.2 GBמשקל הקבצים
  • 13,260הורדות בחודש

מה זה

מדובר במודל שפה עם 2.8 מיליארד פרמטרים שאומן בשיטת DPO בעקבות תהליך האימון של זפיר המקורי מחברת הגמינג פייס. הוא עבר כוונון ישיר על בסיס מאגרי שיחות ומתמטיקה כדי לתפקד כעוזר אישי מובנה, ומחזיר ביצועים מפתיעים ביחס לנפח שלו.

במדד MT-Bench הוא מקבל ציון של 6.64, שזה נתון שמתקרב למודלים ותיקים וגדולים בהרבה כמו מיסטרל 7B או לאמה 2 בגרסת 70 מיליארד פרמטרים. במדד אלפקה הוא רושם שיעור ניצחון של 76 אחוזים, שזה הרבה מעבר למה שראינו ממודלים ישנים בגודל דומה כמו קפיברה 3B. עדיין צריך לזכור שבמדדים תובעניים כמו GSM8K למתמטיקה הוא עומד על 42.3 בלבד, כך שלא מדובר במנוע להסקה כבדה.

מתאים ל

  • בוט שיחה מקומי

    רץ ישירות על מחשב קצה או מעבד רגיל ומגיב מהר להוראות קצרות באנגלית.

  • מיון וסיווג טקסטים

    מעבד כמויות גדולות של קלט מוגדר מראש על גבי כרטיס מסך בסיסי וזול.

  • סיכום פסקאות ממוקד

    התאמת תוכן באנגלית לפורמט מובנה בתוך מגבלת ההקשר של 4,096 טוקנים.

איפה זה נופל

המודל הזה לא כולל מנגנוני הגנה פנימיים נגד פרומפטים עוינים. בבדיקות של המפתחים התברר שאם מבקשים ממנו תוכן פוגעני או מידע שגוי באופן מפורש, הוא פשוט מייצר אותו בלי לסרב. חייבים להציב מסננים נפרדים על הקלט והפלט לפני שמחברים אותו למשתמשי קצה.

בנוסף, האימון נעשה באנגלית בלבד. אם תפנו אליו בעברית תקבלו גבב חסר היגיון, והקשר המקסימלי של 4,096 טוקנים מציב תקרה נמוכה למשימות של ניתוח מסמכים.

שאלות
נפוצות

האם המודל מבין ועונה בעברית?

לא, המודל אומן על מאגרי מידע באנגלית בלבד. פנייה בעברית תניב תוצאות שבורות, ולכן הוא לא מתאים לפרויקטים מקומיים בשפה העברית ללא כוונון נוסף.

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו בפועל?

בדיוק המקורי הקבצים תופסים 5.2 גיגה בייט. כרטיס מסך צנוע עם 6 עד 8 גיגה בייט זיכרון יריץ אותו בצורה חלקה, ואפשר להריץ אותו גם על מעבד עם OpenVINO.

איך מריצים

המשקל הכולל של הקבצים הוא 5.2 גיגה בייט בדיוק של bfloat16, מה שאומר שהוא נכנס בלי בעיה לכרטיס מסך ביתי עם 6 או 8 גיגה בייט של זיכרון VRAM. הטעינה נעשית ישירות דרך ספריית transformers עם קריאה סטנדרטית לתבנית השיחה של הטוקנייזר, וקיימת גם אפשרות להרצה מהירה דרך OpenVINO של אינטל על גבי מעבדים מקומיים.

אם המוצר שלכם צריך לטפל בשיחות מורכבות, הקשר של מעל 4,096 טוקנים או שרשרת הסקה ארוכה, חבל על הזמן של התחזוקה העצמית. במצבים כאלה עדיף לפנות ל־API של מודל ענן חזק.

from transformers import pipeline

pipe = pipeline("text-generation", model="stabilityai/stablelm-zephyr-3b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כרישיון קהילה של Stability AI ולא כקוד פתוח רגיל. שימוש מסחרי מותנה בקבלת רישיון מסחרי ייעודי דרך האתר של החברה. מי שמתכנן לשלב אותו בתוך מוצר רווחי חייב להסדיר מולם את התשלום והזכויות מראש.

הרישיון המלא בעמוד המודל ↗