GPT
G

gpt2-chinese-cluecorpussmall

קוד פתוח

uerרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • gpt2

מודל בסיס קומפקטי ליצירת טקסט בסינית, מאומן על קורפוס מקומי. מתאים למי שרוצה פתרון קל משקל לעיבוד שפה סינית מקומית בלי תקורת ענק.

  • 1,024טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 11,624הורדות בחודש
  • 259לייקים

מה זה

הפרויקט הזה מביא את ארכיטקטורת GPT2 הקלאסית ישירות לשפה הסינית. הוא אומן באמצעות התשתית של UER-py על גבי מאגר הטקסטים CLUECorpusSmall, בתהליך של מיליון צעדים לאורך רצף קצר של 128 טוקנים ועוד רבע מיליון צעדים באורך מלא של 1,024 טוקנים.

בגודל בסיס של 12 שכבות וגודל נסתר של 768, הוא שומר על ממדים סטנדרטיים לגמרי. במקום להשתמש בטוקנייזר הרגיל של GPT2 באנגלית, הוא מחבר בין BertTokenizer עם אוצר המילים הסיני של גוגל לבין ראש שפה של GPT2, מה שמונע חלוקה שבורה של תווים סיניים.

אין כאן תוצאות מדידה או מבחני ביצועים בכרטיס. המשמעות היא שאין נתון רשמי לגבי רמת הדיוק או אובדן המידע שלו, וצריך לבדוק בפועל איך הוא מתמודד עם השלמת משפטים במשימה הספציפית שלכם.

מתאים ל

  • השלמת טקסט בסינית

    מתאים למקלדות או עורכי טקסט שדורשים חיזוי של המשך המשפט בסינית במהירות ובצריכת משאבים נמוכה.

  • אימון המשך על נתונים פנימיים

    משמש כבסיס יציב וזול לכוונון עדין על טקסטים מקצועיים בסינית כשרוצים שליטה מלאה במשקלים.

  • מחקר ובדיקות במעבדה

    גודל הקבצים הקטן מאפשר בדיקת ארכיטקטורות ומערכות אימון מקומיות בלי להזמין שרתי עיבוד יקרים.

איפה זה נופל

הוא מוגבל אך ורק לסינית, ועברית או אנגלית בכלל לא באות בחשבון כאן. חלון ההקשר עומד על 1,024 טוקנים בלבד, כך שאי אפשר להזין מסמכים ארוכים או לנהל שיחה ממושכת בלי לאבד את ההתחלה. מעבר לכך, מדובר במודל שפה גולמי משנת 2022 ללא כוונון להוראות, לכן הוא נוטה לפלוט המשכים אסוציאטיביים וגנריים במקום לענות ישירות לשאלה.

שאלות
נפוצות

האם המודל מבין פקודות בעברית או באנגלית?

לא. הוא אומן ספציפית על טקסטים בסינית ממאגר CLUECorpusSmall ומשתמש במילון מונחים סיני של ברט. טקסט בעברית לא יעבוד ויחזיר פלט משובש.

למה הדוגמה משתמשת ב־BertTokenizer עבור מודל GPT2?

טוקנייזר מקורי של GPT2 נבנה לאנגלית ומפרק תווים סיניים לחתיכות בתים קטנות ולא יעילות. היוצרים שילבו את הטוקנייזר של ברט שמחזיק מילון תווים סיניים מלא, וכך שמרו על ייצוג נכון של השפה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers עם BertTokenizer ו־GPT2LMHeadModel. עם משקל של 1.2 גיגה בייט בקבצים, כרטיס מסך בסיסי או מעבד מודרני מריצים אותו בלי בעיה מקומית. אם אין לכם חומרה ייעודית, אפילו שרת וירטואלי זול יחזיק אותו בזיכרון.

הסדרה הזו כוללת מדרגות החל מגרסת distil בעלת 6 שכבות ועד xlarge של 48 שכבות. אם אתם צריכים רק השלמות קצרות ומהירות, הגרסה הזו מספיקה. מודל חיצוני דרך API עדיף רק אם אתם דורשים תשובות מנומקות לשאלות מורכבות, משימה שהארכיטקטורה הזו לא בנויה לה.

from transformers import pipeline

pipe = pipeline("text-generation", model="uer/gpt2-chinese-cluecorpussmall")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון שימוש בקבצי המודל. מבחינה משפטית, היעדר רישיון מוגדר משאיר את השימוש בו באזור אפור ומסוכן לחברות. לא הייתי מכניס אותו לקוד של מוצר מסחרי סגור לפני פנייה ישירה למפתחים בבקשה להבהרת תנאי ההפצה.

הרישיון המלא בעמוד המודל ↗