GPT
Z

zephyr-7b-gemma-v0.1

קוד פתוח

HuggingFaceH4other2024-03-01

  • transformers
  • tensorboard
  • safetensors
  • gemma
  • text-generation

גרסת צ'אט של גוגל גמא 7B שעברה כיוונון DPO על נתונים סינתטיים. המטרה כאן היא לקבל סייען שיחה פתוח וקליל על בסיס מודל קוד פתוח מוכר.

  • 8.5Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.9 GBמשקל הקבצים
  • 110הורדות בחודש

מה זה

הפיתוח הזה לוקח את המודל הבסיסי של גוגל, gemma-7b, ומעביר אותו תהליך יישור בשני שלבים. תחילה כוונון על DEITA 10K שמכיל שיחות סינתטיות, ואז שלב DPO עם שבעת אלפים דוגמאות שדורגו על ידי GPT-4.

במדד MT Bench שבודק שיחה הוא מגיע לציון 7.81, שזה שיפור מורגש מול 6.38 של גרסת ההוראות הרשמית של גוגל. מצד שני, במבחן IFEval שעוקב אחרי הוראות קפדניות הוא עומד על 28.76 בלבד, תוצאה נמוכה בהרבה מגרסת המקור של גוגל שקיבלה 38.01, ונמוכה משמעותית מגרסת zephyr-7b-beta הוותיקה. בבנצ'מרקים כלליים כמו AGIEval ו־GPT4All הוא עוקף את הדגם של גוגל, אבל עדיין מפגר מעט אחרי סדרת זפיר המקורית שמבוססת על מיסטרל.

מתאים ל

  • בוט שיחה באנגלית

    הציון שלו ב־MT Bench גבוה ומראה שהוא מספק תשובות טבעיות וזורמות בשיחה חופשית.

  • בדיקת מתודולוגיית DPO

    מתאים לחוקרים שרוצים לבחון איך יישור ישיר משפיע על מודל הבסיס של גוגל.

  • משימות ידע כללי קצרות

    מציג תוצאות טובות יותר מדגם המקור במבחני הבנה וידע כמו TruthfulQA ו־GPT4All.

איפה זה נופל

היוצרים מציינים במפורש שהמודל לא עבר שום סינון בטיחות או יישור להעדפות אנושיות בשיטת RLHF, ואין בו מנגנוני סינון תגובות. אם תבקשו ממנו דברים בעייתיים, הוא פשוט ייצר אותם. מעבר לזה, המודל מתמקד בעיקר באנגלית, כך שאין לצפות לביצועים סבירים בעברית. הירידה החדה בציון IFEval אומרת שהוא מתקשה מאוד כשנותנים לו אילוצים נוקשים כמו מבנה תשובה מסוים או מגבלת מילים.

שאלות
נפוצות

האם כדאי להעדיף אותו על פני zephyr-7b-beta הוותיק?

לא תמיד. במבחני שיחה הוא מקבל ציון מעט טוב יותר, אבל בכל הקשור לעמידה בהוראות מורכבות הוא נופל ממנו בפער גדול. אם אתם צריכים פלט בפורמט מדויק, הבטא עדיף.

איך המודל מתמודד עם טקסט בעברית?

האימון התבסס בעיקר על נתונים באנגלית, ומודל הבסיס של גוגל אינו מותאם לעברית באופן מיוחד. לשימושים בשפה העברית עדיף לבחון מודלים שעברו התאמה ייעודית לשפה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־15.9 ג'יגה בייט בפורמט bfloat16. כדי להריץ אותו מקומית בתצורה המלאה תצטרכו כרטיס מסך עם לפחות 24 ג'יגה זיכרון, למשל RTX 3090 או כרטיס שרת מקביל, יחד עם ספריית transformers.

אם השרת שלכם לא מחזיק חומרה כזו, הפתרון הריאלי הוא לעבוד מול נקודת קצה בענן או לכמת אותו ל־4 ביט, אחרת תשלמו הרבה על שרת ייעודי רק בשביל בדיקות ראשוניות.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceH4/zephyr-7b-gemma-v0.1")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת תנאי השימוש של Gemma. השימוש המסחרי תלוי בהגבלות השימוש המקוריות שגוגל קבעה למשפחת המודלים הזו, כולל מדיניות שימוש הוגן ואיסור על יישומים מסוימים, כך שחובה לקרוא את תנאי גוגל לפני הפצה במערכת מסחרית.

הרישיון המלא בעמוד המודל ↗