GPT
O

openchat-3.6-8b-20240522

קוד פתוח

openchatllama32024-05-07

  • transformers
  • safetensors
  • llama
  • text-generation
  • openchat

גרסת כוונון עדין של לאמה 3 שמכוונת לביצועי שיחה וקוד טובים יותר מהמקור. מיועדת למי שמחפש מודל קומפקטי שמצטיין במעקב אחר הוראות בלי להסתבך עם תבניות סרבניות.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 10,301הורדות בחודש

מה זה

מדובר במודל שפה שנשען על ארכיטקטורת לאמה 3 בגודל שמונה מיליארד פרמטרים. צוות הפיתוח אימן אותו בשיטה שמתמודדת עם נתונים באיכות מעורבת, כדי לחדד את יכולות השיחה, כתיבת הקוד והתגובה להוראות מורכבות.

לפי המפתחים, המודל עוקף בביצועיו את גרסת ההוראות הרשמית של לאמה 3 באותו סדר גודל ומתעלה על שילובים אחרים בקוד פתוח. בפרט, הוא פותר בעיה מוכרת שבה המודל המקורי מתקשה לעקוב אחרי תבניות דוגמה מראש, מה שהופך את הפלט שלו לעקבי יותר במשימות שיחה מובנות.

הוא שומר על חלון הקשר של שמונת אלפים מאה תשעים ושניים טוקנים. זה לא חלון ענק לניתוח ספרים שלמים, אבל הוא מספיק בהחלט לצ׳אט ארגוני, סיוע בכתיבת קוד ובניית בוטים מהירים שרצים מקומית.

מתאים ל

  • בוט שירות לקוחות

    עוקב היטב אחרי תבניות שיחה מוגדרות ומחזיר תשובות עקביות בלי לברוח מההקשר.

  • עוזר מקומי לכתיבת קוד

    מתאים לחיבור לסביבת פיתוח מקומית כדי לקבל הצעות והשלמות בלי לשלוח קוד החוצה.

  • שרת צ׳אט ארגוני פנימי

    רץ מאחורי פרוקסי עם הגדרת מפתחות גישה ומספק חלופה פנימית ומאובטחת לשירותים חיצוניים.

איפה זה נופל

למרות השיפורים, המודל עדיין מוגבל ביכולות הבסיס שלו ונופל באתגרי תכנות עמוקים, חישובים מתמטיים מורכבים והסקה לוגית רב שלבית. הוא נוטה להזות עובדות שלא קיימות, והכרטיס מזהיר במפורש שהוא עלול לייצר תכנים פוגעניים או תשובות מוטות ללא סינון חיצוני. בנוסף, חובה להגדיר ידנית את טוקן הסיום הנכון, אחרת הוא פשוט ימשיך לפלוט טקסט בלי לעצור.

שאלות
נפוצות

איזו תבנית שיחה צריך להגדיר כדי שהמודל יעבוד נכון?

המודל דורש תבנית מותאמת שבה המשתמש מוגדר כ־GPT4 Correct User והעוזר כ־GPT4 Correct Assistant. מומלץ להשתמש ב־tokenizer המובנה כדי למנוע טעויות שיובילו לפלט מקולקל.

האם הוא מתאים לעיבוד מסמכים ארוכים מאוד?

לא. חלון ההקשר שלו מוגבל לשמונת אלפים מאה תשעים ושניים טוקנים, כך שהוא מיועד בעיקר לשיחות ולמשימות קצרות וממוקדות ולא לניתוח תיקי מסמכים כבדים.

איך מריצים

המשקל הכולל של הקבצים עומד על חמישה עשר גיגהבייט בדיוק bfloat16. כדי להריץ אותו כמו שצריך עם שרת vLLM בתפוקה גבוהה, המפתחים ממליצים על כרטיס מסך עם עשרים וארבעה גיגהבייט זיכרון. אפשר להשתמש גם בספריית transformers הרגילה, אבל חבילת השרת הייעודית שלהם כבר מגיעה עם תאימות לממשק של OpenAI ומאזינה כברירת מחדל בפורט 18888.

אם יש לכם כרטיס מסך מתאים, ההרצה העצמית תיתן לכם פרטיות מלאה ושליטה על הנתונים. אם אין לכם חומרה כזו או שאתם צריכים לטפל בעומסים בלתי צפויים, החזקת שרת ייעודי כזה בענן תעלה לא מעט כסף, ובמקרה כזה קריאה לשירות ענן מנוהל תהיה זולה ופשוטה בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="openchat/openchat-3.6-8b-20240522")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה 3 של מטא. הוא מאפשר שימוש מסחרי ומחקר, אבל מחייב שמירה על תנאי השימוש המקוריים של מטא, כולל הגבלת כמות משתמשים חודשית עצומה ומדיניות שימוש הוגן.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗