GPT
O

opt-1.3b

קוד פתוח

facebookother2022-05-11

  • transformers
  • pytorch
  • tf
  • jax
  • opt

מודל שפה פתוח של מטא בגודל צנוע של 1.3 מיליארד פרמטרים. הוא מיועד בעיקר למי שרוצה לחקור התנהגות של מודלי שפה או לאמן אותם למשימה ספציפית מקומית.

  • 2,048טוקנים בהקשר
  • 7.4 GBמשקל הקבצים
  • 105,558הורדות בחודש
  • 186לייקים

מה זה

מטא פרסמה את סדרת המודלים הזו כדי להתחרות בביצועים של משפחת GPT-3, אבל בקוד פתוח שמאפשר לחקור איך הדברים עובדים בפנים. הגרסה הזו כוללת 24 שכבות בלבד, והיא מאומנת על 180 מיליארד טוקנים מטקסטים גולמיים שנאספו מחמישה מאגרי מידע גדולים, כולל רדיט, ספרים, מאמרי חדשות ו־The Pile.

הוא עובד בארכיטקטורת Causal LM קלאסית שמנחשת את הטוקן הבא. מכיוון שמדובר במודל בסיס גולמי שלא עבר כוונון להוראות, הוא לא מתנהג כמו צ'אטבוט מוכן אלא ממשיך טקסט ישירות לפי הקשר של עד 2,048 טוקנים בלבד, בעיקר באנגלית.

מתאים ל

  • מחקר הטיות במודלי שפה

    הוא כולל משקולות פתוחות וקל לבדיקה מקומית כדי לחקור הזיות והטיות מגדריות.

  • כוונון למשימות ייעודיות באנגלית

    בסיס קל משקל שאפשר לאמן מחדש על דאטה פנימי בלי צורך בתשתיות ענק.

  • השלמת טקסט פשוטה מקומית

    רץ ישירות על כרטיס מסך פשוט ומאפשר המשך משפטים בלי לשלוח מידע החוצה.

איפה זה נופל

המודל הזה סובל מהטיות חזקות, הזיות ותכנים בעייתיים, עקב איסוף טקסטים לא מסוננים מרדיט ומהרשת הפתוחה. כרטיס המודל מציג מפורשות דוגמאות להבדלים מגדריים סטריאוטיפיים במקצועות שהוא משלים. הוא כמעט לא כולל נתונים בעברית, ולכן פלט בשפה זו אינו שמיש. כל ההטיות האלו יעברו ישירות לכל גרסה מכווננת שתאמנו עליו.

אותה משפחה

opt יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה עובד בעברית?

האימון נעשה בעיקר על טקסטים באנגלית ממאגרי חדשות ורשת, למעט כמות זניחה של שפות אחרות מ־CommonCrawl. אין לצפות ממנו להבנה או ליצירה של עברית תקינה.

האם אפשר להשתמש בו כמו צ'אטבוט ישר אחרי ההורדה?

לא. זהו מודל בסיס גולמי שממשיך מחרוזות טקסט ולא מודל שעבר אימון על הוראות או דיאלוג, כך שתשובותיו אינן מכוונות לשיחה ללא כוונון נוסף.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־7.4 גיגה בייט בדיוק של float16, כך שכרטיס מסך בסיסי עם 8 או 12 גיגה זיכרון מריץ אותו בלי מאמץ מיוחד. אפשר להעלות אותו ישירות דרך ספריית transformers בפייתון עם פייפליין קצר של ייצור טקסט.

אם אתם רק צריכים תשובות מהירות או שיחה אינטראקטיבית, כדאי לקרוא לשירות ענן קיים, כי להרים שרת בשביל מודל בסיס שלא עבר התאמה ידרוש מכם עבודת כוונון נוספת על הנתונים שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/opt-1.3b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י. המשמעות היא שחובה לבדוק את תנאי הרישיון המקוריים של מטא במאגר שלהם לפני שמשלבים את המשקולות במוצר מסחרי, ולא להניח שהשימוש חופשי לגמרי.

הרישיון המלא בעמוד המודל ↗