GPT
O

opt-125m

קוד פתוח

facebookother2022-05-11

  • transformers
  • pytorch
  • tf
  • jax
  • opt

הגרסה הקטנה ביותר בסדרת OPT של פייסבוק תופסת פחות מגיגהבייט אחד על הדיסק. היא מתאימה בעיקר לבדיקות קוד מהירות, למחקר על מודלי שפה או כבסיס קל לאימון נוסף.

  • 2,048טוקנים בהקשר
  • 718 MBמשקל הקבצים
  • 8,820,283הורדות בחודש
  • 296לייקים

מה זה

המודל פותח על ידי חוקרי מטא כדי לשחזר את הביצועים והארכיטקטורה של משפחת GPT-3 בקוד פתוח. מדובר ברשת דקודר בלבד עם 12 שכבות, שנועדה ליצירת טקסט רציף על ידי חיזוי הטוקן הבא. מטא אימנה אותו על מאגר של 180 מיליארד טוקנים, שכלל בין היתר ספרים, רדיט, ויקיפדיה ומאמרי חדשות.

בגודל של 125 מיליון פרמטרים, הוא משמש בעיקר נקודת ייחוס. הוא מאפשר לבחון התנהגות של מודלי שפה, להריץ ניסויי פרומפטים ולהשוות תוצאות למודלים גדולים יותר באותה סדרה, בלי לגעת בתשתיות ענן יקרות. רוב הטקסט ששימש לאימון נכתב באנגלית, ולכן יכולת העבודה שלו בשפות אחרות מוגבלת מאוד.

מתאים ל

  • בדיקת צינורות עבודה

    אימות מהיר של תהליכי עיבוד והזנת נתונים בסביבת פיתוח מקומית בלי לחכות לזמני טעינה ארוכים.

  • אימון ייעודי למשימה צרה

    בסיס קל משקל לכוונון על סט נתונים קטן לצורך משימות ספציפיות כמו מיון או השלמת משפטים באנגלית.

  • מחקר על הטיות במודלים

    ניתוח האופן שבו מודלים קטנים לומדים הטיות ורעילות מתוך מאגרי אינטרנט ציבוריים כמו רדיט.

איפה זה נופל

המודל סובל מבעיות חמורות של דיוק והזיות בטקסט שהוא פולט. היוצרים מציינים במפורש שהנתונים איתם אומן הגיעו מהאינטרנט ללא סינון מלא, ומכילים תוכן פוגעני, הטיות חברתיות חזקות ושפה מעליבה. תופעות אלו מחלחלות ישירות לכל יצירת טקסט ויופיעו גם אם תבצעו אימון נוסף. לא מומלץ לחבר אותו לממשק משתמש חי או להסתמך עליו ביצירת תוכן אמין.

אותה משפחה

opt יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מסוגל לכתוב או להבין עברית?

הוא אומן כמעט לחלוטין על תוכן באנגלית מתוך מאגרים כמו The Pile ו־CCNews. יש בו כמות זעירה של שפות זרות שנאספה במקרה בתוך CommonCrawl, אבל הוא לא מיועד להבנה או ליצירה של עברית תקינה.

כמה זיכרון עבודה נדרש כדי להריץ אותו?

המודל שוקל 718 מגהבייט בלבד. אפילו עם תקורה של מערכת ההפעלה וספריית פייתון, כל מחשב עם 2 גיגהבייט זיכרון פנוי יריץ אותו בצורה חלקה על המעבד.

איך מריצים

המשקל הכולל של הקבצים עומד על 718 מגהבייט בדיוק float16. אפשר לטעון ולהריץ אותו ישירות בתוך ספריית transformers על מעבד רגיל של מחשב נייד, ללא צורך במאיץ גרפי ייעודי או זיכרון מיוחד.

בגלל הדרישות הנמוכות, אין שום סיבה לשלם על שירותי ענן או לקרוא ל־API חיצוני. כל מכונה בסיסית מריצה אותו מקומית בכמה שורות פייתון דרך צינור text-generation, כאשר ברירת המחדל דטרמיניסטית ודורשת הפעלת דגימה אם רוצים גיוון בטקסט.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/opt-125m")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר במערכת תחת other. המשמעות היא שלא מדובר ברישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT, אלא בהסכם שימוש ייעודי של מטא. אם אתם מתכננים להטמיע אותו במוצר מסחרי, חובה לפתוח את תנאי הרישיון המקוריים של הפרויקט ולוודא שהשימוש אינו מוגבל למחקר אקדמי בלבד.

הרישיון המלא בעמוד המודל ↗