GPT
M

mGPT

קוד פתוח

ai-foreverapache-2.02022-04-07

  • transformers
  • pytorch
  • gpt2
  • text-generation
  • multilingual

מודל שפה רב לשוני שמציע תמיכה בשישים ואחת שפות, כולל עברית, במשקל קל יחסית. פתרון מתאים למי שחייב מודל מקומי פתוח שלא דורש שרת ענק.

  • 2,048טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 14,414הורדות בחודש
  • 271לייקים

מה זה

מדובר במודל גנרטיבי עם 1.3 מיליארד פרמטרים שמבוסס על מבנה GPT-2 עם שחזור ארכיטקטורת GPT-3 ומנגנון קשב דליל. הצוות של SberDevices אימן אותו על 61 שפות מתוך 25 משפחות שפה שונות, תוך שימוש במקורות כמו ויקיפדיה ומאגר C4, בהיקף של 600 גיגה בייט טקסט ו־440 מיליארד טוקנים. היתרון המרכזי שלו מול פתרונות אחרים בתקופתו הוא הרחבת היכולת לשפות עם משאבים מועטים, כולל עברית וערבית, באותו משקל מודל.

במבחני הביצועים המפתחים מציגים תוצאות שמקבילות למודלים מסדרת XGLM, אך עם כיסוי שפות רחב יותר. בפועל, מודל כזה נותן מענה בסיסי לייצור טקסט בכמה שפות בלי צורך לפצל מערכות, אבל בגלל שהמשאבים חולקו בין 61 שפות שונות, העומק שלו בכל שפה בודדת נמוך בהרבה מזה של מודל ייעודי שהתמקד בשפה אחת.

מתאים ל

  • השלמת טקסט במכשיר קצה

    המשקל הקל מאפשר הרצה מקומית על מחשבים פשוטים ללא צורך בכרטיסי מסך יקרים.

  • פרויקטים בלשניים ורב לשוניים

    אימון אחיד על עשרות שפות מאפשר מחקר והשוואה בין משפחות שפה שונות.

  • בסיס לכוונון בשפות דלות משאב

    מציע נקודת זינוק מוכנה לכוונון עדין לשפות שאין להן מודלים ייעודיים ברשת.

איפה זה נופל

האימון המקורי בוצע באורך רצף של 512 טוקנים בלבד, למרות חלון הקשר המרבי, מה שמגביל מאוד את היכולת שלו להתמודד עם הנחיות ארוכות או לזכור הקשר מורכב. בנוסף, חלוקת 1.3 מיליארד פרמטרים בין 61 שפות יוצרת פשרות קשות. בעברית ובשפות שאינן אנגלית תקבלו לעיתים קרובות שיבושים, שגיאות דקדוקיות והזיות עובדתיות, כך שחובה לבדוק היטב את הפלט לפני שילוב שלו במערכת אמיתית.

אותה משפחה

mGPT יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך המודל מתמודד עם עברית בפועל?

הוא מייצר עברית קריאה ברמה בסיסית, אך האימון נשען בעיקר על ויקיפדיה ומאגרי רשת גולמיים. בגלל הגודל הקטן והחלוקה לשפות רבות, הוא נוטה לחזרתיות ולחוסר דיוק תחבירי.

האם הוא מסוגל לנהל שיחה כמו צ׳אטבוט מודרני?

לא. מדובר במודל השלמת טקסט גולמי משנת 2022 שלא עבר כוונון להוראות או התאמה לשיחה, ולכן הוא פשוט ממשיך את הטקסט שאתם מזינים לו.

איך מריצים

הקבצים שוקלים כ־3.2 גיגה בייט בפורמט float32, כך שאפשר להריץ אותו דרך ספריית transformers על כרטיס מסך ביתי פשוט עם 6 עד 8 גיגה זיכרון, או אפילו ישירות על מעבד סביר בלי להיתקע.

אם כל מה שאתם צריכים זה רק ניתוח טקסט או מענה בעברית בלי אילוצי פרטיות, עדיף להשתמש ב־API מודרני מרוחק. הרצה מקומית של המודל הזה כדאית רק כשאתם מוכרחים לעבוד בלי חיבור לרשת, בסביבה מבודדת, או כשנדרשת עלות אפסית לתשתיות קיימות.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai-forever/mGPT")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 3.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗