GPT
O

openchat-3.5-0106-gemma

קוד פתוח

openchatother2024-03-09

  • transformers
  • safetensors
  • gemma
  • text-generation
  • conversational

גרסה מכווננת של מודל ג׳מה מבית גוגל שמגיעה לביצועים חזקים במיוחד בקוד ובמתמטיקה. היא מתאימה למי שרוצה חלופה מקומית למיסטרל עם יכולת הסקה גבוהה בקטגוריית שבעה מיליארד פרמטרים.

  • 8.5Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.9 GBמשקל הקבצים
  • 1,815הורדות בחודש

מה זה

הצוות של אופן צ׳אט לקח את הבסיס של ג׳מה מבית גוגל ואימן אותו בשיטת C-RLFT על מערך הנתונים שלהם. התוצאה היא מודל שמציג קפיצה עצומה מול גרסאות הבסיס של ג׳מה, בייחוד בהבנת הוראות, שבהן המודל המקורי של גוגל התקשה לעקוב אחרי תבניות בסיסיות.

במבחני ביצועים הוא מציג מספרים מרשימים מאוד לגודל שלו. ב־GSM8K הוא מגיע ל־81.5 וב־HumanEval ל־67.7, שזה ציון גבוה יותר מגרסת המיסטרל המקבילה שלהם ואפילו מ־ChatGPT במבחן הזה. הוא שומר על ממוצע כללי של 64.4 על פני מגוון מבחנים, מה שהופך אותו לאחד מאימוני ג׳מה המובילים שפורסמו.

מתאים ל

  • פתרון בעיות מתמטיקה

    עם ציון של 81.5 במבחן GSM8K, הוא חזק מאוד בהסקה כמותית ביחס למודלים מקומיים קטנים.

  • כתיבת קוד ובדיקות

    תוצאה של 67.7 ב־HumanEval מאפשרת לו לייצר ולתקן קטעי קוד ברמה שעוקפת מודלים גדולים בהרבה.

  • עוזר שיחה מקומי

    ציון 7.83 ב־MT-Bench מראה יכולת שיחה טבעית ומענה להוראות מורכבות בסביבה מקומית סגורה.

איפה זה נופל

היוצרים מזהירים במפורש שהמודל נוטה להזיות ולייצור מידע לא מדויק, ולכן אי אפשר להסתמך עליו בנתונים עובדתיים קריטיים בלי בדיקה. בנוסף, המודל עלול לייצר תוכן פוגעני, מוטה או לא בטוח, כך שמערכת שחשופה למשתמשי קצה חייבת שכבת סינון ובקרה חיצונית.

עוד נקודה בעייתית היא הוספת הוראות מערכת. הכרטיס מציין במפורש ששימוש ב־system message אינו מומלץ ועלול לפגוע בביצועים של המודל, מה שמגביל את השליטה בהתנהגות שלו באפליקציות מורכבות.

שאלות
נפוצות

האם כדאי להגדיר לו הנחיית מערכת בשיחה?

עדיף שלא. יוצרי המודל כתבו במפורש שהוספת system message עלולה לפגוע באיכות התשובות, ועדיף להכניס את כל ההנחיות ישירות בפניית המשתמש בתבנית הרגילה.

האם המודל מתאים לריצה על מחשב אישי רגיל?

הוא שוקל 15.9GB ודורש מעבד גרפי עם 24GB זיכרון כדי לפעול כראוי. מחשב בלי כרטיס מסך מקצועי יתקשה מאוד להריץ אותו בקצב סביר.

מה ההבדל בינו לבין גרסת המיסטרל של אותו צוות?

גרסת הג׳מה מציגה תוצאות עדיפות במתמטיקה עם 81.5 מול 77.4 ב־GSM8K, אבל מפסידה מעט בבדיקות אמינות קוד ועובדות כמו HumanEval ו־TruthfulQA.

איך מריצים

במשקל של כמעט ששה עשר גיגה בייט בדיוק bfloat16, המודל הזה דורש כרטיס מסך עם 24GB זיכרון כדי לרוץ בצורה חלקה ויציבה. המפתחים ממליצים להשתמש בספריית vLLM דרך שרת פנימי שתומך במבנה ה־API של OpenAI ומאזין לפורט מקומי.

אם אין לכם כרטיס מתאים בסביבת הפיתוח, הפעלת שרת ייעודי בענן עולה כסף לפי שעה, וייתכן שפתרון מנוהל של מודל חיצוני יהיה זול ופשוט יותר. בריצה עצמאית צריך לשים לב לתבנית הפרומפט שמשתמשת בטוקן הסיום הספציפי של ג׳מה כדי למנוע יצירת טקסט אינסופית.

from transformers import pipeline

pipe = pipeline("text-generation", model="openchat/openchat-3.5-0106-gemma")
print(pipe("שלום"))

הרישיון

הקוד וההתאמות של אופן צ׳אט משוחררים תחת אפאצ׳י 2.0, אבל המודל עצמו נשען על ג׳מה של גוגל ומסומן ברישיון other. המפתחים עצמם מציינים שגוגל לא השתמשה ברישיון קוד פתוח תקני כמו מיסטרל, ולכן לפני שימוש מסחרי במוצר חובה לקרוא את תנאי השימוש הייעודיים של ג׳מה ולוודא שהשימוש שלכם עומד במגבלות של גוגל.

הרישיון המלא בעמוד המודל ↗