GPT
Z

zephyr-7b-beta

קוד פתוח

HuggingFaceH4mit2023-10-26

  • transformers
  • pytorch
  • safetensors
  • mistral
  • text-generation

גרסת צ'אט מהירה וקומפקטית שמבוססת על מיסטרל שבעה מיליארד, ומציגה ביצועי שיחה שמתחרים במודלים כבדים בהרבה בזכות אימון העדפות ישיר.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.0 GBמשקל הקבצים
  • 61,708הורדות בחודש

מה זה

הבסיס כאן הוא מיסטרל שבעה מיליארד שעבר כוונון עדין על שיחות סינתטיות ולאחר מכן אימון מסוג DPO מול דירוגים שנוצרו על ידי מודלים חזקים. הרעיון היה לנקות את מנגנוני הסינון המובנים בנתונים כדי לייצר עוזר שיחה מועיל וישיר בהרבה, בלי הנטייה של מודלים פתוחים אחרים להתחמק מתשובות.

במדדי ההערכה של שנת ההשקה שלו הוא הוביל את קטגוריית שבעה מיליארד הפרמטרים. ציון של 7.34 במבחן MT-Bench ושיעור ניצחון של 90.6 אחוזים בבנצ'מרק של אלפקה מציבים אותו מעל מודלים פתוחים עצומים כמו לאמה 70B בשיחה חופשית, ומאוד קרוב לחוויית שיחה עם מנועים מסחריים סגורים.

מתאים ל

  • עוזר שיחה פנימי באנגלית

    נותן מענה שוטף וטבעי באנגלית בלי לשלם לפי טוקן לחברות חיצוניות.

  • עיבוד מסמכים ארוכים

    חלון של שלושים ושניים אלף טוקנים מאפשר לקרוא טקסטים ארוכים במודל קל.

  • סיכום ושכתוב תוכן

    עוקב היטב אחרי הנחיות ניסוח ישירות בלי להתחמק מתשובות.

איפה זה נופל

ההסרה של שכבות הסינון הפכה אותו למועיל, אבל השאירה אותו בלי הגנות בטיחות אנושיות מסורתיות. אם תבקשו ממנו פלט בעייתי או מסוכן, הוא פשוט ייצר אותו בלי להתווכח. בנוסף, למרות החוזק שלו בשיחה וטקסט כללי, היוצרים מודים שהוא מפגר משמעותית מאחורי המודלים המסחריים במשימות תכנות ובפתרון בעיות מתמטיות. הוא גם מוגדר בעיקר לאנגלית, כך שלעברית מורכבת הוא לא הבחירה הנכונה.

שאלות
נפוצות

האם הוא מתאים לייצור קוד?

לא ממש. התיעוד מבהיר שבמשימות מתמטיקה ותכנות הוא חלש בהרבה מהמודלים המסחריים הגדולים. אם אתם צריכים מחולל קוד לפרודקשן, עדיף להסתכל על מודלים שהוכשרו במיוחד לפיתוח.

אפשר להשתמש בו במוצר מול לקוחות בלי סינון נוסף?

ממש לא מומלץ. לא נעשה לו אימון בטיחות אנושי מסוג RLHF, ולכן הוא ייצר טקסט בעייתי ופוגעני אם קלט המשתמש ידחוף אותו לשם. חובה להציב שכבת בדיקה משלכם לפני שמציגים את הפלט ללקוח.

איך מריצים

כדי לטעון את המשקלים המקוריים בדיוק bfloat16 בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות שמונה עשר עד עשרים גיגה זיכרון פנימי, בעיקר אם מנצלים את חלון ההקשר המלא שמגיע עד 32,768 טוקנים. אם מריצים אותו מקומית על מחשב פיתוח, כדאי לחפש גרסאות מכווצות או להשתמש בספריית transformers עם הגדרות טעינה חסכוניות.

אם אין לכם כרטיס ייעודי בשרת, להרים אותו עצמאית זה כאב ראש מיותר. במצב כזה עדיף לצרוך אותו דרך נקודות קצה של ספקי תשתית מנוהלים שמחזיקים אותו מוכן לקריאות רשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceH4/zephyr-7b-beta")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, שזה הדבר הכי פתוח שאפשר לבקש. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בתוך מוצר סגור ולהפיץ אותו חופשי, כל עוד משאירים את הצהרת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗