GPT
O

opt-6.7b

קוד פתוח

facebookother2022-05-11

  • transformers
  • pytorch
  • tf
  • jax
  • opt

גרסה פתוחה ומחקרית בקנה מידה של שבעה מיליארד פרמטרים, שנבנתה כדי לשחזר את היכולות של משפחת GPT-3. מתאימה למי שחוקר הטיות שפה או מחפש בסיס פתוח לאימון המשך באנגלית.

  • 2,048טוקנים בהקשר
  • 37.2 GBמשקל הקבצים
  • 61,664הורדות בחודש
  • 121לייקים

מה זה

מטא פרסמה את סדרת המודלים הזו במטרה לספק לקהילת המחקר גישה פתוחה למודלי שפה גדולים, שהיו סגורים עד אז מאחורי ממשקי תשלום. המודל הספציפי אומן על מאגר של מאה ושמונים מיליארד טוקנים, שכולל ספרים, חדשות, רדיט וחלקים מפרויקט The Pile, בארכיטקטורת פענוח בלבד שדומה לדור הקודם של מודלי שפה.

הוא נועד ליצירת טקסט ולהערכת ביצועים במשימות שונות ללא אימון מוקדם או עם מעט דוגמאות. אין כאן מודל שיחה מכויל שעבר התאמה עם בני אדם, אלא כלי בסיס שמשלים טקסטים ומחקה את המבנה והסגנון של החומרים שעליהם התחנך באינטרנט.

מתאים ל

  • מחקר הטיות שפה

    מאפשר לבדוק כיצד מודלי בסיס משחזרים סטריאוטיפים מתוך נתוני אינטרנט לא מסוננים.

  • אימון ייעודי למשימה

    משמש כנקודת מוצא גולמית לאימון המשך על נתונים פנימיים של ארגון.

  • השלמת טקסט באנגלית

    מייצר המשכים לטקסטים קצרים באנגלית בסגנון מבוסס מקורות רשת מגוונים.

איפה זה נופל

המודל סובל מהטיות חברתיות קשות, פליטת ביטויים פוגעניים והזיות, כפי שהחוקרים עצמם מודים בעקבות שימוש בדאטה גולמי מרדיט ומהרשת. הדוגמאות בכרטיס ממחישות שיוך מקצועות סטריאוטיפי ומובהק בין נשים לגברים. בנוסף, חלון ההקשר מוגבל לאלפיים ארבעים ושמונה טוקנים בלבד, והוא אינו מיועד או מותאם לעברית אלא בעיקר לאנגלית.

אותה משפחה

opt יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ועונה בעברית?

האימון נעשה כמעט כולו על טקסטים באנגלית, למעט שברירי שפות זרות שהסתננו ממאגרי רשת. הוא לא נבנה לעברית, יתקשה מאוד להפיק משפטים קוהרנטיים בשפה הזו, ולא מתאים לעבודה מקומית.

למה הטוקנייזר קורס בזמן הטעינה הראשונית?

יש בעיה ידועה ברמת הספרייה שמונעת מהטוקנייזר המהיר לפעול תקין עם המודל הזה. הפתרון היחיד הוא להגדיר את הפרמטר שטוען את הטוקנייזר האיטי באופן ידני בקוד פייתון.

איך מריצים

כדי לטעון את המודל צריך כרטיס גרפי עם זיכרון משמעותי, שכן הקבצים שלו שוקלים מעל שלושים ושבעה גיגהבייט ורצים בדיוק חצי. התיעוד מבהיר במפורש שלא כדאי להשתמש בצינור היצירה הרגיל של הספרייה, אלא לטעון את המשקלים ישירות לחומרה ולהפעיל את פונקציית היצירה הידנית.

יש גם באג טכני ספציפי שמונע מהטוקנייזר המהיר לעבוד, ולכן חובה להגדיר שימוש בטוקנייזר האיטי כדי שהקוד לא יישבר. אם אין לכם שרת ייעודי עם מעבד גרפי חזק, מדובר בהרצה כבדה ומסורבלת מאוד ביחס לתפוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/opt-6.7b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כחריג ולא כרישיון קוד פתוח רגיל. הוא מיועד למטרות מחקר ודורש קריאה זהירה של תנאי השימוש המקוריים של מטא לפני שמשלבים אותו במוצר כלשהו, בטח אם הכוונה היא שימוש מסחרי.

הרישיון המלא בעמוד המודל ↗