GPT
1

14B

קוד פתוח

CausalLMwtfpl2023-10-22

  • transformers
  • pytorch
  • llama
  • text-generation
  • llama2

מודל שיחה בגודל בינוני המשלב משקולות מ־Qwen וארכיטקטורה של LLaMA 2. הוא פונה למי שמחפש ביצועים גבוהים במבחנים תיאורטיים במיוחד באנגלית ובסינית, בלי להגיע לממדי ענק.

  • 8,192טוקנים בהקשר
  • 26.4 GBמשקל הקבצים
  • 223הורדות בחודש
  • 313לייקים

מה זה

מדובר במודל שנוצר משילוב משקולות של Qwen ו־LLaMA 2, והותאם לארכיטקטורת LlamaForCausalLM המוכרת. האימון שלו התבסס על 1.3 מיליארד טוקנים של מידע סינתטי בלבד, שעבר עיבוד ממקורות שונים וערכים מובחרים בוויקיפדיה ובאתרי תוכן קהילתיים, יחד עם התאמה לפורמט פרומפט של LLaVA 1.5 שמאפשר חיבור עתידי לעיבוד תמונה.

במבחני הביצועים הוא מציג מספרים חריגים לגודל שלו. הוא השיג ציון ממוצע של 67.36 ב־MMLU, תוצאה של 73.10 ב־CEval הסיני שעוקפת אפילו את התוצאה המדווחת של GPT-4 שם, ודיוק של מעל 70 אחוז ב־GSM8K למתמטיקה. בלוח AlpacaEval הוא רשם 88.26 אחוזי ניצחון. המספרים האלה מראים יכולת חזקה מאוד במענה לשאלות מובנות ומשימות אנליטיות מוגדרות בשפות היעד.

מתאים ל

  • מענה לשאלות בסינית ואנגלית

    ציוני MMLU ו־CEval הגבוהים הופכים אותו למתאים לאחזור ידע מוגדר ופתרון שאלות ידע בשפות הנתמכות.

  • פתרון בעיות חישוב

    התוצאה במבחן GSM8K מראה יכולת חזקה לפרק משימות מתמטיות שלב אחר שלב ביחס למודלים בקטגוריית גודל זו.

  • הכנה למודל מולטימודאלי

    התאמת הפרומפט למבנה LLaVA 1.5 מאפשרת לחבר אליו רכיב ראייה ממוחשבת לפרויקטים שדורשים קלט תמונה.

איפה זה נופל

המודל מגיע ללא סינון בטיחות כלל. היוצרים מציינים שלא היה להם כוח מחשוב להריץ RLHF לבטיחות ואתיקה, והאימון לא כלל דוגמאות של סירוב לפקודות פוגעניות. המודל יכול לפלוט תכנים אלימים, בוטים או מיניים ללא כל התראה, וכל סינון תוכן נופל עליכם.

בנוסף, המודל אומן רק עבור אנגלית וסינית. אין בו תמיכה מוצהרת במשימות בעברית, ולמעט יכולת מסוימת שנמדדה ביפנית, הוא לא נבדק בשפות אחרות. חלון ההקשר עומד על 8,192 טוקנים בלבד בלי מנגנון הרחבה.

שאלות
נפוצות

האם כדאי להריץ גרסה מכומתת של המודל כדי לחסוך זיכרון?

היוצרים ממליצים שלא לכמת אותו. גרסאות GPTQ ו־AWQ לא רשמיות עלולות לסבול מפגיעה קשה בביצועים בגלל אופן הכיול על טקסט שאינו תואם את המידע הסינתטי. אם חייבים לכמת, ההמלצה היחידה מהמפתחים היא להשתמש ב־GGUF, או פשוט לרדת למודל 7B.

האם המודל מוכן לעבודה ישירה מול משתמשים?

לא. המפתחים הצהירו בפירוש שלא בוצע שום יישור קו אתי או אימון לסרב לבקשות בעייתיות, ולכן הוא פולט שפה פוגענית, אלימות ותכנים לא מצונזרים. אם רוצים להשתמש בו במוצר, אתם חייבים להקים שכבת סינון מילים ובדיקת פלט חיצונית משלכם.

איך מריצים

הקבצים שוקלים 26.4 גיגה בייט בפורמט bfloat16 ומחולקים ל־15 קבצים, כך שצריך כרטיס מסך עם לפחות 30 עד 32 גיגה בייט זיכרון כדי להריץ את המודל המקורי באופן נקי. המפתחים ממליצים במפורש לא להשתמש בכימות של המודל הזה, ומזהירים שגרסאות GPTQ או AWQ לא רשמיות עלולות לסבול מבעיות כי הן כוילו על טקסטים שלא מתאימים לאימון הסינתטי שלו.

אם אין לכם כרטיס מסך מתאים, היוצרים מציעים להשתמש במודל ה־7B שלהם במקום לכמת את הנוכחי, או להשתמש ב־GGUF בלבד אם חייבים דחיסה. בהרצה צריך להשתמש בספריית transformers הרגילה בתבנית ChatML, וחובה להגדיר בה System Prompt לא ריק כדי לקבל פלט הגיוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="CausalLM/14B")
print(pipe("שלום"))

הרישיון

המודל מסומן ברישיון המאפשר לעשות הכל בלי תנאים, אך היוצרים מדגישים שהוא מבוסס על משקולות מ־Qwen ו־LLaMA 2. בפועל אתם כפופים להגבלות השימוש המסחרי של שני המודלים המקוריים הללו, כך שאי אפשר להסתמך על הרישיון המוצהר כדי לשלב אותו במוצר מסחרי בלי בדיקת תנאי המקור.

הרישיון המלא בעמוד המודל ↗