GPT
L

llama2-13b-orca-8k-3319

קוד פתוח

OpenAssistantother2023-07-24

  • transformers
  • pytorch
  • llama
  • text-generation
  • sft

גרסה מכווננת של Llama 2 בגודל 13B שהורחבה לחלון הקשר של 8,192 טוקנים. היא מתאימה למי שצריך מודל שיחה באנגלית שמסוגל להחזיק טקסט ארוך מהרגיל.

  • 8,192טוקנים בהקשר
  • 24.2 GBמשקל הקבצים
  • 149הורדות בחודש
  • 133לייקים

מה זה

הבסיס כאן הוא Llama 2 13B הרגיל, אבל צוות OpenAssistant הרחיב את חלון ההקשר שלו לפי שניים באמצעות linear RoPE scaling. כדי ללמד אותו להתמודד עם שיחות ארוכות באמת, הם אימנו אותו על orca-chat, גרסה מורחבת של דאטה-סט Dolphin שמבוסס על GPT-4, יחד עם דגימות מתוך RedPajama ו־FanFics שתמכו באימון ההקשר הארוך.

במקום סתם לענות קצר, המודל אומן סביב 15 הנחיות מערכת ספציפיות מסגנון Orca שדורשות ממנו לפרק משימות, להסביר צעד אחר צעד, ולנמק בחירות. זה מייצר תשובות מפורטות ומנומקות יותר ממודל 13B גולמי, במיוחד בשיחות מתמשכות באנגלית.

מתאים ל

  • הסבר משימות מורכבות באנגלית

    הוא אומן על הנחיות Orca שמאלצות אותו לחשוב צעד אחר צעד ולנמק פתרונות.

  • שיחות מרובות תורות

    חלון של 8,192 טוקנים מאפשר להחזיק היסטוריית שיחה ארוכה בלי לקטוע את ההקשר.

  • פירוק והסבר מושגים למתחילים

    אחת מהנחיות האימון המרכזיות שלו יועדה להסבר מפורט כאילו המשתמש הוא ילד בן חמש.

איפה זה נופל

המודל מוגדר ומאומן רק באנגלית, ולכן לא הייתי בונה עליו לשום משימה בעברית. בנוסף, מדובר בצ'קפוינט מוקדם יחסית מ־2023 של 3,319 צעדי אימון, והוא תלוי לחלוטין בתבנית שיחה מדויקת עם תגיות מוגדרות כדי לא לאבד את הידיים והרגליים. אם לא משתמשים באחת מתבניות ההנחיה המקוריות של Orca, איכות ההסברים יורדת משמעותית.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מציין אנגלית בלבד. המודל הבסיסי ודאטה-סט האימון Orca ממוקדים באנגלית, ולכן ניסיון להשתמש בו בעברית יפיק כנראה שגיאות או פלט מקוטע.

מדוע חובה להתקין דווקא transformers 4.31.0 ומעלה?

ההרחבה ל־8,192 טוקנים נשענת על מימוש RoPE scaling שהתווסף לספרייה רק מגרסה זו. גרסאות ישנות יותר פשוט לא יקראו את ההקשר נכון ויקרסו או ייצרו ג'יבריש.

איך מריצים

כדי להריץ אותו צריך transformers בגרסה 4.31.0 ומעלה, אחרת התמיכה ב־RoPE scaling לא תעבוד והפלט ישתבש. המשקלים תופסים 24.2 ג'יגה-בייט בדיוק של float16, מה שאומר שצריך כרטיס מסך עם לפחות 30 עד 40 ג'יגה-בייט של VRAM, כמו A100 או זוג כרטיסים קטנים יותר, כדי להחזיק את המודל יחד עם חלון מלא של 8k טוקנים.

אם אין לכם שרת ייעודי זמין ואתם צריכים רק שאילתות פה ושם, העלות של החזקת חומרה כזו דולקת רציפה לא משתלמת, ועדיף לשלוח קריאות API לשירותים חיצוניים שמארחים מודלים דומים לפי שימוש.

from transformers import pipeline

pipe = pipeline("text-generation", model="OpenAssistant/llama2-13b-orca-8k-3319")
print(pipe("שלום"))

הרישיון

המודל כפוף לרישיון Llama 2 Community של Meta, למרות שבמטאדאטה סומן other. הרישיון מאפשר שימוש מסחרי חופשי כל עוד אין לכם מעל 700 מיליון משתמשים פעילים בחודש, ובכפוף למדיניות השימוש המקובל של Meta.

הרישיון המלא בעמוד המודל ↗