GPT
G

gpt2-spanish

קוד פתוח

DeepESPmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • gpt2

גרסה ספרדית מובהקת לארכיטקטורת GPT2 הבסיסית, שאומנה מאפס על ספרות וויקיפדיה. מתאימה למי שצריך מחולל טקסט מקומי, זול וקל בספרדית בלי תלות באנגלית.

  • 1,024טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 8,391הורדות בחודש
  • 39לייקים

מה זה

מדובר במימוש של GPT2 בגרסת small הקלאסית, שאומן כולו מאפס על 11.5 גיגה-בייט של טקסטים בספרדית. המאגר כלל 3.5 גיגה-בייט מוויקיפדיה ועוד שמונה גיגה-בייט של ספרים, כולל סיפורת, מחזות, שירה ומסות. בגלל המקורות האלה, הטקסט שהוא פולט נוטה לסגנון כתוב, ספרותי ועשיר יותר מטקסט רשת ממוצע.

ההבדל המשמעותי לעומת סתם הרצה של מודל כללי הוא הטוקנייזר. במקום להשתמש במילון האנגלי המקורי של OpenAI, היוצרים אימנו BPE ייעודי לספרדית בגודל של 50,257 מונחים. הצעד הזה מונע פירוק מיותר של מילים ספרדיות לחתיכות קטנות, משפר את ההבנה התחבירית ומנצל טוב יותר את חלון ההקשר.

מתאים ל

  • השלמת משפטים בספרדית

    הטוקנייזר הייעודי מבין את הדקדוק וההטיות בספרדית בצורה חלקה.

  • כתיבה יצירתית בספרדית

    רוב חומר האימון מבוסס על ספרות, שירה ומחזות בספרדית.

  • עבודה מקומית ללא רשת

    הקובץ שוקל רק 1.2 גיגה-בייט ורץ בקלות על מעבד סטנדרטי.

איפה זה נופל

חלון ההקשר עומד על 1,024 טוקנים בלבד, מה שמגביל מאוד ניתוח של מסמכים ארוכים או שיחות מתמשכות. מעבר לזה, המפתחים מצהירים במפורש שחומרי האימון לא עברו שום סינון. המודל עלול לפלוט ביטויים פוגעניים, הטיות או תוכן בעייתי, ואי אפשר להסתמך על תקינות הפלט שלו בסביבת ייצור בלי להוסיף שכבת בדיקה משלכם.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. הוא אומן מאפס על קורפוס בספרדית בלבד וכולל מילון מונחים שהותאם לשפה זו. הזנה של עברית תניב פלט משובש או חסר משמעות לחלוטין.

מה משמעות הטוקנים המיוחדים כמו ax1 בכרטיס המודל?

היוצרים הוסיפו מראש טוקנים ייעודיים לצורכי הרחבה ואימונים עתידיים, למשל למבנה שיחה. בשימוש שגרתי במודל הנוכחי אין להם משמעות מעשית ואפשר להתעלם מהם.

איך מריצים

המודל שוקל 1.2 גיגה-בייט בלבד, כך שלא צריך שום חומרה מיוחדת כדי להרים אותו. הוא רץ בלי בעיה על מעבד של מחשב נייד ממוצע, ובוודאי על כל כרטיס מסך בסיסי או שרת ענן פשוט, בדיוק כמו בסביבת Colab שבה הוא אומן עם כרטיס V100 בודד.

טוענים אותו ישירות דרך ספריית transformers בסביבת פייתון רגילה לעבודה במשימות יצירת טקסט. אם אתם צריכים רק השלמת משפטים קלה או בדיקות מקומיות, אין שום סיבה לשלם על API חיצוני. מצד שני, אם אתם מחפשים תשובות עובדתיות מורכבות, צ'אט מרובה שלבים או הבנה של הקשר ארוך, תצטרכו מודל מודרני בהרבה ולא את המשקל הזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="DeepESP/gpt2-spanish")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש או לשלב אותו בתוך מוצר סגור. התנאי היחיד הוא השארת הודעת זכויות היוצרים והרישיון המקורי בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗