GPT
O

OpenOrcaxOpenChat-Preview2-13B

קוד פתוח

Open-Orcallama22023-07-31

  • transformers
  • pytorch
  • llama
  • text-generation
  • en

שילוב בין דאטה־סט של OpenOrca לשיטת האימון של OpenChat על בסיס Llama 2. הוא נבנה למי שצריך מודל 13B עם יכולות היסק ופתרון בעיות בלי לשלם על מודלי ענק.

  • 4,096טוקנים בהקשר
  • 24.2 GBמשקל הקבצים
  • 195הורדות בחודש
  • 102לייקים

מה זה

הצוות של OpenOrca לקח את Llama 2 בגודל 13B ואימן אותו על תת־קבוצה מסוננת של נתונים שנוצרו עם GPT-4, מתוך מטרה לשחזר ולעקוף את המחקר המקורי של Orca מבית מיקרוסופט. תהליך האימון השתמש באלגוריתם האריזה של OpenChat, מה שקיצר משמעותית את זמן הריצה ודרש פחות מחמישית מגודל הדאטה המקורי.

במבחני היסק קשים הוא הגיע לממוצע של 0.488 ב־BigBench-Hard ו־0.447 ב־AGIEval, שזה קצת מעל התוצאות של מאמר Orca המקורי. בזמן השחרור שלו הוא הוביל את טבלת ה־13B של Hugging Face וטבלת GPT4ALL, והציג רמת ביצועים שמתקרבת למודלים פתוחים גדולים בהרבה כמו Falcon 40B.

מתאים ל

  • היסק לוגי באנגלית

    התוצאות שלו ב־BigBench-Hard מראות יכולת גבוהה בניתוח בעיות מורכבות יחסית לגודל 13B.

  • עוזר שיחה מבוסס vLLM

    הוא תומך בשרת המותאם של OpenChat שמאפשר שילוב קל דרך API תואם פורמט OpenAI.

  • פתרון בעיות מתמטיות קצרות

    האימון על הדאטה של Orca מכוון במיוחד לחשיבה צעד אחר צעד במשימות כמותיות.

איפה זה נופל

הבעיה המרכזית שלו היא רגישות קיצונית לתבנית הפרומפט. המודל אומן ספציפית לעבוד עם הפורמט של OpenChat Llama2 V1, ואם לא שומרים במדויק על תגיות הסיום כמו end_of_turn, הפלט מתבלבל והוא מייצר שיחות אינסופיות של משתמש ועוזר שממציאים טקסט ברצף. בנוסף, חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, שזה מעט מאוד למסמכים ארוכים, ואין פה שום התאמה ייעודית לעברית.

שאלות
נפוצות

אפשר להריץ אותו בלי תבנית הפרומפט המיוחדת?

לא מומלץ בכלל. המודל אומן בצורה הדוקה עם תגיות המבנה של OpenChat Llama2 V1. סטייה מהתבנית גורמת לפלט להימרח ולהמשיך לייצר שאלות ותשובות מומצאות בין המשתמש לעוזר במקום לעצור.

האם הוא מבין עברית?

המודל הוגדר ואומן על נתונים באנגלית בלבד. בסיס ה־Llama 2 כולל מעט מאוד חשיפה לעברית, ולכן הפלט בעברית יהיה שבור, איטי ומלא שגיאות. הוא לא מתאים למשימות בשפה המקומית.

איזה כרטיס מסך צריך כדי להרים אותו?

במשקל המקורי נדרשים לפחות 40GB של VRAM בזמן הרצה, מה שמחייב כרטיס כמו A6000 או שני כרטיסי 24GB. כדי להסתפק בחומרה חלשה יותר, צריך להוריד את גרסאות ה־GPTQ או ה־GGML המכווצות.

איך מריצים

כדי להריץ אותו בקבצים הגולמיים ב־bfloat16 צריך מעל 40GB של זיכרון כרטיס מסך, מה שמחייב חומרה מקצועית כמו כרטיס A6000 עם 48GB, או חלוקה בין שני כרטיסי RTX 3090 ביתיים של 24GB. אם המטרה היא מהירות, המפתחים ממליצים להשתמש בשרת ה־vLLM של OpenChat שמציע ממשק תואם OpenAI.

למי שאין שרת כזה בהישג יד, TheBloke שחרר גרסאות מכווצות ב־GGML ו־GPTQ שרצות על זיכרון נמוך בהרבה. אם העומס שלכם נמוך או שאין כרטיס מסך ייעודי פנוי, פנייה ל־API מסחרי תהיה כנראה זולה ופשוטה יותר מלתחזק מכונה עם שני כרטיסי מסך עבור מודל 13B.

from transformers import pipeline

pipe = pipeline("text-generation", model="Open-Orca/OpenOrcaxOpenChat-Preview2-13B")
print(pipe("שלום"))

הרישיון

המודל כפוף לרישיון llama2 של מטא. הוא מאפשר שימוש מסחרי חופשי לרוב העסקים, כל עוד אין לכם מעל 700 מיליון משתמשים פעילים בחודש, ואתם שומרים על תנאי השימוש המקובלים ומדיניות הבטיחות שהוגדרו עבור Llama 2.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗