GPT
O

opt-2.7b

קוד פתוח

facebookother2022-05-11

  • transformers
  • pytorch
  • tf
  • jax
  • opt

מודל שפה בסיסי מבית מטא שנבנה כדי לשחזר את היכולות של משפחת GPT-3 בקוד פתוח. הוא מתאים בעיקר לחוקרים ומפתחים שמחפשים בסיס ישיר באנגלית לניסויים ואימוני המשך.

  • 2,048טוקנים בהקשר
  • 19.8 GBמשקל הקבצים
  • 32,681הורדות בחודש
  • 89לייקים

מה זה

מטא שחררה את המודל כחלק מסדרת ארכיטקטורות Decoder-only שמטרתן לספק חלופה פתוחה למודלים סגורים. הוא אומן על 180 מיליארד טוקנים ממקורות מגוונים כמו BookCorpus, The Pile ורדיט, במטרה לחקות את שיטות העבודה וההערכה של GPT-3. הוא מבצע משימות השלמת טקסט, יצירת תוכן והערכה במצב Few-shot ישירות דרך פרומפטים.

המשקל שלו עומד על 2.7 מיליארד פרמטרים, גודל ביניים שמנסה לאזן בין יכולת הבעה לבין דרישות חומרה סבירות. הוא לא עבר התאמה לשיחות או כוונון להוראות, ולכן הוא מתנהג כמו מחולל טקסט סטטיסטי טהור שממשיך את הקלט שניתן לו ולא כעוזר אישי שעונה ישירות לשאלות.

מתאים ל

  • אימון המשך למשימות ספציפיות

    משמש נקודת מוצא נוחה לכוונון על דאטה-סט ייעודי באנגלית בזכות ארכיטקטורה מוכרת.

  • מחקר על הטיות במודלי שפה

    מאפשר לבחון השפעות של דאטה לא מסונן על פלט המודל ללא תלות במערכות מסחריות סגורות.

  • השלמת טקסט באנגלית

    מייצר המשכים יצירתיים לפסקאות ומשפטים קצרים באנגלית עם דגימת טוקנים פשוטה.

איפה זה נופל

המודל אומן על טקסט לא מסונן מהרשת, כולל חלקים גדולים מרדיט, ולכן הוא סובל מהטיות מובנות, פליטת טקסט פוגעני והזיות עובדתיות. יוצרי המודל מזהירים במפורש מחוסר גיוון ביצירה ומתוכן בעייתי שעלול לצוץ, במיוחד סביב תפקידי מגדר או סטריאוטיפים. בנוסף, הוא כמעט לא מכיר עברית, ומאחר שהוא מודל בסיס ללא Instruction tuning, הוא לא יודע לעקוב אחרי הוראות מורכבות ופשוט ימשיך לפלוט טקסט אסוציאטיבי.

אותה משפחה

opt יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ומייצר עברית?

לא. המודל אומן כמעט לחלוטין על תוכן באנגלית. אם תזינו לו טקסט בעברית תקבלו ג'יבריש או פלטים קטועים ולא רלוונטיים, ולכן הוא לא מתאים לפרויקטים בעברית.

האם אפשר להשתמש בו ישירות בתור צ'אטבוט?

לא מומלץ בכלל. הוא לא עבר שום כוונון שיחה (RLHF או Instruction tuning), ולכן הוא לא יודע לענות לשאלות אלא רק לנחש את המילים הבאות ברצף. כדי לקבל ממנו צ'אט, תצטרכו לאמן אותו מחדש על דיאלוגים.

איך מריצים

כדי להריץ אותו מקומית צריך להוריד כמעט עשרים גיגה של קבצים בפורמט float16, ולטעון אותם לזיכרון באמצעות ספריית transformers הרגילה של פייתון. כרטיס מסך בודד עם 8 עד 12 גיגה של VRAM יתקשה להחזיק את המודל במלואו ללא קוונטיזציה, ולכן לריצה חלקה בזיכרון מלא תצטרכו כרטיס עם לפחות 16 גיגה VRAM.

אם אין לכם כרטיס כזה זמין בסביבת הפיתוח או שאתם לא מתכננים לעשות לו Fine-tuning למשימה פרטית, קריאה ל־API חיצוני של שירות קיים תחסוך את כאב הראש של ניהול התשתית וההורדה הכבדה.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/opt-2.7b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other בכרטיס המודל. המשמעות היא שאין כאן רישיון קוד פתוח סטנדרטי כמו MIT או Apache, וחובה לבדוק את מסמך הרישיון המקורי של מטא במאגר כדי לדעת אם מותר להשתמש בו לצרכים מסחריים או למחקר בלבד.

הרישיון המלא בעמוד המודל ↗