GPT
Z

zephyr-7b-alpha

קוד פתוח

HuggingFaceH4mit2023-10-09

  • transformers
  • pytorch
  • safetensors
  • mistral
  • text-generation

גרסת צ'אט מכווננת של מיסטרל שמיועדת לספק מענה ישיר וממוקד. היא מתאימה למי שמחפש מודל שיחה באנגלית בגודל שבעה מיליארד פרמטרים בלי מנגנוני סינון כבדים.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.0 GBמשקל הקבצים
  • 2,500הורדות בחודש

מה זה

מדובר במודל שפותח כדי לשמש כעוזר שיחה, והוא בנוי על גבי Mistral-7B-v0.1. המפתחים לקחו את מודל הבסיס ואימנו אותו בשיטה שנקראת Direct Preference Optimization, תוך שימוש במאגרי נתונים סינתטיים. תחילה הוא עבר כוונון עדין על גרסה של UltraChat שמכילה דיאלוגים סינתטיים מרובי נושאים, ולאחר מכן עבר יישור עם DPOTrainer על מאגר UltraFeedback שמכיל 64 אלף פרומפטים ותשובות שדורגו על ידי GPT-4.

הייחוד כאן לעומת מודלים מקבילים בגודל שבעה מיליארד פרמטרים הוא ההחלטה להסיר את היישור המובנה שהיה במאגרי הנתונים האלה. לפי הבדיקות של המפתחים, ההסרה הזו העלתה את הביצועים במבחן MT Bench והפכה אותו למועיל יותר במענה לשאלות, במקום שיסרב או יתחמק מנושאים מורכבים. בתוצאות האימון רואים דיוק תגמול של מעל 78 אחוזים ומרחק ברור בין תשובות נבחרות לנדחות, מה שמעיד שהמודל למד היטב להעדיף את סגנון התשובות שסומן כאיכותי.

מתאים ל

  • בוט תמיכה פנימי באנגלית

    הוא אומן על דיאלוגים מורכבים של שאלות ותשובות ויודע לנהל שיחה רציפה בלי לחסום פרומפטים טכניים.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 32 אלף טוקנים מאפשר להזין טקסטים נרחבים בבת אחת לצורך תמצות וחיפוש מידע.

  • מחקר על שיטות יישור

    הוא מספק נקודת ייחוס מעולה למי שרוצה לבדוק תוצאות DPO על בסיס מיסטרל בקוד פתוח.

איפה זה נופל

המודל הזה לא עבר יישור מול העדפות אנושיות בשיטות כמו RLHF, ואין בו מנגנוני סינון תגובות בזמן אמת. המפתחים מציינים במפורש שהוא נוטה לייצר פלטים בעייתיים כשמבקשים ממנו לעשות זאת, והסרת הבטיחות ממאגרי הנתונים החריפה את התופעה. בנוסף, המודל מיועד בעיקר לאנגלית, והרכב המידע שעליו אומן מודל הבסיס אינו ידוע במלואו. אל תשימו אותו מול משתמשי קצה בלי שכבת בדיקה וסינון משלכם.

שאלות
נפוצות

האם הוא מתאים לעבודה בעברית?

הכרטיס מציין שהשפה העיקרית היא אנגלית. מודל הבסיס מיסטרל מכיר שפות נוספות באופן בסיסי, אבל האימון הנוסף התמקד באנגלית ולכן לא הייתי בונה עליו למשימות שיחה או הפקת תוכן בעברית.

מה ההבדל בינו לבין Mistral-7B המקורי?

הגרסה הזו עברה שני שלבי אימון נוספים על שיחות ודירוגי העדפות בעזרת DPO. המודל המקורי מיועד להשלמת טקסט כללית, בעוד שגרסה זו מונחית לפעול ישירות כעוזר שיחה שעונה לפניות משתמשים.

איך מריצים

כדי להריץ אותו צריך להוריד 27 גיגה בייט של קבצים בפורמט bfloat16. להרצה מלאה בדיוק המקורי נדרש כרטיס מסך עם לפחות 16 גיגה בייט זיכרון גרפי, ואם רוצים לנצל את חלון ההקשר המלא של 32 אלף טוקנים תצטרכו עוד זיכרון משמעותי עבור ה־KV cache או חלוקה בין מספר כרטיסים. המפתחים עצמם השתמשו ב־16 מעבדים גרפיים לאימון.

הוא מופעל ישירות דרך ספריית transformers בפייתון עם פונקציית pipeline. אם אין לכם חומרה ייעודית זמינה ואתם צריכים רק לבדוק תגובות מדי פעם, עדיף להשתמש בדמו הרשמי ב־Hugging Face Spaces או לקרוא לו דרך ספק צד שלישי במקום להחזיק שרת יקר באוויר.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceH4/zephyr-7b-alpha")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT. זהו רישיון קצר ומתירני שמאפשר שימוש מסחרי, שינוי קוד, הפצה ושילוב במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור על האחריות בתוך הקוד או ההפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗