GPT
O

opt-30b

קוד פתוח

facebookother2022-05-11

  • transformers
  • pytorch
  • tf
  • jax
  • opt

גרסת 30 מיליארד פרמטרים מבית מטא שנועדה לתת לחוקרים גישה למודל שמתחרה בארכיטקטורת GPT-3. הוא מתאים למי שרוצה לחקור מודל שפה גדול בלי להסתמך על שירותי ענן סגורים.

  • 2,048טוקנים בהקשר
  • 167 GBמשקל הקבצים
  • 2,910הורדות בחודש
  • 137לייקים

מה זה

מטא שחררה את סדרת המודלים הזו במטרה להנגיש מודלים בסדרי גודל של GPT-3 לקהילת המחקר, מתוך גישה שמאפשרת לבחון התנהגות של מודלים ענקיים ישירות על המשקולות. המודל הספציפי הזה יושב באמצע הסדרה, עם 48 שכבות של ארכיטקטורת פענוח בלבד, ואומן לחזות את הטוקן הבא על גבי מאגר של 180 מיליארד טוקנים שכולל ספרים, חדשות, רדיט וחלקים מ־The Pile.

הוא בעיקר יודע לייצר טקסט באנגלית ולהגיב לפרומפטים בשיטות של zero-shot או few-shot. מטא תכננו את האימון והבדיקות לפי הפרוטוקולים והפרומפטים המקוריים של GPT-3, אבל מדובר במודל בסיס גולמי לחלוטין. הוא לא עבר התאמה לשיחה והוא נועד לייצור טקסט ישיר או לכוונון המשך על משימות ספציפיות.

מתאים ל

  • מחקר על הטיות במודלי שפה

    הוא מספק משקולות פתוחות לחלוטין של מודל ענק, מה שמאפשר לבדוק כיצד נוצרות סטיגמות במהלך האימון.

  • כוונון למשימות באנגלית

    מתאים לאימון המשך על דאטה ייעודי באנגלית בזכות ארכיטקטורה מוכרת שנתמכת בספריית transformers.

  • שחזור ניסויי GPT-3

    הוא תוכנן לעקוב אחרי הפרומפטים ומערכי הניסוי של GPT-3, מה שמאפשר להשוות תוצאות ישירות.

איפה זה נופל

המודל אומן על טקסטים מהרשת ללא סינון עמוק, ולכן הוא מייצר הטיות מגדריות מובהקות, בדיוק כפי שהדגימו המפתחים בעצמם בהשוואה בין מקצועות לגברים ולנשים. הוא סובל מהזיות, חזרתיות בייצור הטקסט, ומכיל בחומרי האימון תכנים פוגעניים מרדיט ומ־Common Crawl. חלון ההקשר מוגבל ל־2,048 טוקנים בלבד, וכמעט שאין בו נתונים שאינם באנגלית, כך שלעברית הוא לא רלוונטי בכלל.

אותה משפחה

opt יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייח רגיל עם כרטיס מסך בודד?

לא. קבצי המודל שוקלים 167 ג'יגה בייט ודורשים זיכרון גרפי עצום רק כדי להיטען ב־float16. תצטרכו שרת ייעודי מרובה כרטיסי מסך חזקים כדי להעלות אותו לפעולה.

האם המודל מסוגל לעבד ולייצר טקסט בעברית?

הוא אומן כמעט אך ורק על מאגרים באנגלית, למעט שברירי מידע אקראיים שדלפו מ־Common Crawl. הוא אינו מיועד לשום שימוש מעשי בעברית.

איך מריצים

המשקולות לבדן תופסות 167 ג'יגה בייט ב־33 קבצים, כך שכדי לטעון אותו בזיכרון של כרטיסי מסך ב־float16 צריך חומרה ייעודית רצינית. מטא ממליצים לעקוף את מנגנון ה־pipeline הרגיל של transformers ולקרוא ישירות למתודת generate עם float16, אחרת צריכת הזיכרון מזנקת.

בנוסף, הטוקנייזר המהיר של הספרייה לא עובד איתו בצורה תקינה, וצריך להגדיר שימוש בטוקנייזר האיטי בקוד. אם אין לכם שרת עם כמה מעבדים גרפיים חזקים שמחוברים יחד ומוכנים להרצה מקומית כבדה, עדיף להשתמש ב־API מרוחק במקום לנסות להחזיק את המפלצת הזו בבית.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/opt-30b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת סיווג מותאם אישית של מטא ולא כרישיון קוד פתוח סטנדרטי. לפי מסמכי המקור של הפרויקט, הגישה והשימוש במודלים נועדו לצורכי מחקר בלבד כדי לאפשר בחינה של הטיות ובטיחות. המשמעות עבור מי שבונה מוצר היא שאי אפשר להטמיע אותו ביישום מסחרי או לחלק אותו ללקוחות כחלק משירות קיים, וצריך לבדוק היטב את תנאי הרישיון המקוריים לפני שנוגעים בקבצים.

הרישיון המלא בעמוד המודל ↗