GPT
7

7B

קוד פתוח

CausalLMwtfpl2023-10-22

  • transformers
  • pytorch
  • llama
  • text-generation
  • llama2

גרסה מכווצת של מודל 14B שנבנתה מראש עבור speculative sampling לצד אחיו הגדול. הוא מציג ציוני מבחנים מרשימים באנגלית ובסינית, אבל מגיע ללא סינוני בטיחות בכלל.

  • 8,192טוקנים בהקשר
  • 14.4 GBמשקל הקבצים
  • 141הורדות בחודש
  • 137לייקים

מה זה

מדובר במודל שנוצר באמצעות זיקוק של גרסת ה־14B ומבוסס על שילוב משקולות של Qwen יחד עם LLaMA 2. הארכיטקטורה זהה לחלוטין ל־LLaMA 2, כולל חישוב ה־attention המקורי, והוא אומן על 1.3 מיליארד טוקנים סינתטיים שנכתבו ועובדו מחדש ממקורות כמו ויקיפדיה, Fandom ו־Moegirlpedia.

במדדי ביצועים הוא רושם הישגים חריגים לגודל שלו: ממוצע של 63.82 ב־MMLU, ציון של 70.27 ב־CEval הסיני ודיוק של 59.21% ב־GSM8K ללא דוגמאות מקדימות. המשמעות בפועל היא יכולת חזקה מאוד בפתרון בעיות מתמטיות, הבנה מדעית וידע כללי יחסית למודלים אחרים באותה קטגוריית משקל.

בנוסף, הוא עבר התאמה למבנה הפרומפטים של LLaVA 1.5, מה שאומר שאפשר לחבר אליו רכיב ראייה ממוחשבת כמו ViT ולהשתמש בו כמנוע שפה למשימות מולטימודליות.

מתאים ל

  • האצת דגימה לצד 14B

    הוא תוכנן במקור כמודל טיוטה קל ל־speculative sampling מול גרסת ה־14B.

  • פתרון בעיות מתמטיות באנגלית

    הוא משיג מעל 59% במבחן GSM8K ללא דוגמאות, ציון גבוה משמעותית מהמקובל בקטגוריה.

  • בסיס למודל מולטימודלי

    הוא אומן מראש על הפורמט של LLaVA 1.5 ומאפשר חיבור מהיר לרכיב ויזואלי חיצוני.

איפה זה נופל

היוצרים מודים בפירוש שהמודל נועד לדגימה משוערת לצד המודל הגדול ולא לעבודה עצמאית, ולכן הוא סובל מהזיות ומתשובות לא אמינות כשמשתמשים בו לבד. בנוסף, לא נעשה שום תהליך של RLHF או אימון לסרבנות, מה שאומר שהוא יפלוט תוכן אלים, פוגעני או מיני אם לא תציבו שכבת סינון קשיחה משלכם לפני המשתמשים. עברית אינה ברשימת השפות הנתמכות, והמיקוד הוא אך ורק באנגלית ובסינית.

שאלות
נפוצות

האם המודל מתאים לשיחה ישירה עם לקוחות?

לא מומלץ בכלל להציב אותו ישירות מול משתמשי קצה. המודל לא עבר שום התאמת בטיחות, אין לו מנגנון סירוב והוא נוטה להזיות כשהוא רץ לבד ללא המודל הגדול.

איך צריך לנסח אליו פניות בקוד?

הוא עובד עם הפורמט של ChatML ומחייב הנחיית מערכת מוגדרת. השארת שדה ה־system prompt ריק תפגע בצורה קשה באיכות התוצאות.

איך מריצים

כדי להריץ אותו בדיוק המקורי של bfloat16 תצטרכו כרטיס מסך עם לפחות 16GB זיכרון ייעודי, או לחלופין להשתמש בגרסאות מכווצות של GGUF דרך llama.cpp שיכולות לרוץ גם על זיכרון מערכת רגיל. המפתחים ממליצים בפירוש להימנע מכיולים של GPTQ או AWQ בגלל שהם פוגעים בביצועים על הדאטה שעליו הוא אומן.

הוא משתמש בספריית transformers רגילה עם מבנה ChatML, ומחייב הגדרת system prompt שלא תהיה ריקה. אם אתם צריכים רק מענה גנרי בסיסי ולא מריצים מערך שכולל את מודל ה־14B, לרוב יהיה פשוט וזול יותר להשתמש ב־API קיים במקום לתחזק תשתית מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="CausalLM/7B")
print(pipe("שלום"))

הרישיון

הרישיון הרשמי בעמוד הוא WTFPL, שמתיר לעשות בקוד ובקבצים כל מה שרוצים ללא שום תנאי. עם זאת, היוצרים מדגישים שהוא נשען על משקולות של Qwen ושל LLaMA 2, ולכן כל שימוש מסחרי כפוף בפועל גם להגבלות הרישוי של שתי החברות האלו.

הרישיון המלא בעמוד המודל ↗