GPT
O

openchat-3.5-0106

קוד פתוח

openchatapache-2.02024-01-07

  • transformers
  • safetensors
  • mistral
  • text-generation
  • openchat

גרסת כוונון עדין על בסיס מיסטרל שמציגה ביצועי קוד ושיחה חריגים לגודל של שבעה מיליארד פרמטרים. היא פונה למי שמחפש מודל קומפקטי לריצה מקומית בלי לשלם על שרתים יקרים.

  • 7.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 10,652הורדות בחודש

מה זה

הבסיס כאן הוא Mistral 7B, אבל האימון מתמקד בשיטה של למידה מנתונים באיכות מעורבת. המטרה של המפתחים היתה לסחוט מקסימום יכולת הסקה מכרטיס מסך בודד של משתמש קצה, והתוצאות במבחנים ממקמות אותו מעל מודלים פתוחים מקבילים מאותו דור, ואפילו מעל גרסאות מוקדמות של ChatGPT במבחני קוד ספציפיים כמו HumanEval.

בפועל הוא מציע שני מצבי עבודה שמופעלים דרך פרומפטים שונים: מצב ברירת מחדל שמיועד לקוד ולשיחה כללית, ומצב ייעודי לחישובים מתמטיים. מעבר לכך יש בו תמיכה ניסיונית בהערכת תשובות ומשוב על פלטים של מודלים אחרים.

מתאים ל

  • עוזר פיתוח מקומי

    התוצאה שלו ב־HumanEval גבוהה מאוד לקטגוריה, ומשתלמת להשלמת קוד אופליין על מחשב פיתוח חזק.

  • פתרון בעיות חישוב

    מצב Math Correct הייעודי נותן דיוק משופר במשימות מתמטיקה ישירות בהשוואה למודלים כלליים קטנים.

  • הערכת פלטים ודירוג

    היכולת הניסיונית לשמש כשופט מאפשרת לבחון ולדרג תשובות של מודלים אחרים בתהליכי אוטומציה.

איפה זה נופל

למרות הציונים הגבוהים במבחנים, הוא סובל מהמגבלות הטבעיות של מודל בסיס בגודל 7B. משימות היגיון מורכבות, בעיות מתמטיקה רב־שלביות ואתגרי תכנות עמוקים חושפים טעויות מהר מאוד.

בנוסף, הכרטיס מזהיר במפורש מפני הזיות וייצור מידע שגוי לחלוטין. אין כאן מנגנוני בטיחות מובנים חזקים, ולכן המודל עלול לפלוט תוכן פוגעני, מוטה או לא בטוח אם לא שמים לפניו שכבת סינון ובקרה נפרדת.

שאלות
נפוצות

האם המודל דורש תבנית שיחה מיוחדת?

כן. כדי לקבל את הביצועים המדווחים חייבים לעבוד עם התבנית המדויקת שלו שמגדירה תפקידים כמו GPT4 Correct User, או להשתמש בטוקנייזר שמחיל אותה אוטומטית, ולהגדיר את הטוקן לסיום התור בהתאם.

האם הוא מסוגל להחליף את GPT-4 במערכות ייצור?

לא. למרות ההשוואות לגרסאות מוקדמות של ChatGPT במבחנים סינתטיים, זה עדיין מודל 7B. הוא נוטה להזיות בהקשרים רחבים ולא יחזיק לוגיקה עסקית מסועפת ללא בדיקה מתמדת.

איך מריצים אותו על שרת עם מספר כרטיסי מסך?

פקודת השרת הרשמית מאפשרת להפעיל חלוקת עומסים באמצעות Ray. מוסיפים את הפרמטר tensor-parallel-size עם מספר הכרטיסים הזמינים כדי לפצל את המשקלים על פני הזיכרון.

איך מריצים

כדי להריץ אותו כמו שצריך המפתחים ממליצים על שרת ייעודי שמבוסס על vLLM עם תאימות מלאה לפורמט ה־API של OpenAI. המשקלים תופסים כ־13.5 ג'יגה בייט בפורמט המקורי, מה שאומר שכרטיס מסך צרכני עם 24GB VRAM מחזיק אותו בקלות ומאפשר קצב תגובה מהיר מאוד.

אם אין לכם כרטיס עם מספיק זיכרון או שאתם צריכים רק בדיקות מזדמנות, אין סיבה לקנות חומרה. במצב כזה עדיף לשכור מופע לפי שעה בענן או לגשת למודלים גדולים יותר דרך ממשקי API חיצוניים.

from transformers import pipeline

pipe = pipeline("text-generation", model="openchat/openchat-3.5-0106")
print(pipe("שלום"))

הרישיון

המודל והקוד משוחררים תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו בתוך מוצר ולסגור את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗