GPT
E

ernie-3.0-base-zh

קוד פתוח

nghuyongרישיון לא דווח2022-08-22

  • transformers
  • pytorch
  • ernie
  • fill-mask
  • zh

מודל סיני קומפקטי שמיועד להשלמת מילים וטקסט חסר בתוך משפטים. תרצו אותו רק אם אתם עובדים ישירות עם טקסטים בסינית ומחפשים משהו קל להרצה מקומית.

  • 2,048טוקנים בהקשר
  • 453 MBמשקל הקבצים
  • 10,210הורדות בחודש
  • 112לייקים

מה זה

מדובר בהמרה לפייתורץ' של מודל הבסיס ERNIE 3.0 שפותח במקור על תשתית PaddlePaddle. המודל בנוי בתוך ארכיטקטורת ErnieForMaskedLM עם 12 שכבות, ונועד בעיקר למשימות של שפה והבנת הקשר בסגנון fill-mask, כלומר חיזוי של מילים מוסתרות בתוך משפט קיים בסינית.

הייחוד של סדרת ERNIE מול BERT רגיל מגיע משילוב ידע חיצוני ומבני שפה במהלך האימון המקורי, כפי שמתואר במאמר של החוקרים. הגרסה הספציפית הזו שוקלת 453 מגה-בייט בלבד, מה שהופך אותה לגרסת בסיס נוחה מאוד לעבודה אם אתם רוצים לאמן אותה הלאה למשימות סיווג או חילוץ מידע בסינית.

מתאים ל

  • השלמת מילים בסינית

    חיזוי טוקנים חסרים בתוך משפטים בסינית עד אורך של 2,048 טוקנים.

  • בסיס לאימון מסווגים

    משקל קל של 453 מגה-בייט מאפשר לכוונן אותו במהירות למשימות מיון טקסט.

  • חילוץ ישויות ומבנים

    שימוש בייצוגי השפה העשירים של ארכיטקטורת ERNIE עבור עיבוד סינית.

איפה זה נופל

הוא מוגדר לשפה הסינית בלבד. אם תנסו לזרוק עליו עברית או אנגלית תקבלו תוצאות חסרות משמעות לחלוטין. הוא גם לא מודל שיחה ולא מייצר טקסט חופשי, אלא מודל ייצוג שנועד להשלמת מילים חסרות או לבסיס עבור fine-tuning. מעבר לכך, מדובר בהמרה עצמאית של משתמש ולא במאגר הרשמי של מפתחי המודל, אז צריך לבדוק בעצמכם שהפלט תואם בדיוק לביצועים המקוריים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסט בעברית?

לא. המודל אומן ותוכנן אך ורק עבור סינית (zh). אם תזינו לתוכו עברית הוא פשוט לא ידע איך לקרוא או לעבד אותה נכון.

האם המודל מתאים לצ'אט או לכתיבת תשובות?

לא, הוא מוגדר למשימת fill-mask. הוא יודע לחזות מילים חסרות בתוך משפט קיים, ולא לנהל שיחה או לייצר פסקאות חדשות מאפס.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון, בעזרת BertTokenizer ו־ErnieForMaskedLM תחת השם nghuyong/ernie-3.0-base-zh. אין כאן הגדרות מיוחדות או תלויות חריגות.

משקל כולל של 453 מגה-בייט וחלון הקשר של 2,048 טוקנים אומרים שהוא ירוץ בלי שום מאמץ כמעט על כל כרטיס מסך בסיסי, ואפילו על מעבד רגיל. אין שום סיבה לחפש ספק ענן או API חיצוני בשביל גודל כזה, אתם פשוט מורידים ומריצים אצלכם.

from transformers import pipeline

pipe = pipeline("fill-mask", model="nghuyong/ernie-3.0-base-zh")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 453 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא דיווח על רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו, בטח שלא במוצר מסחרי. לפני שמשלבים אותו במערכת אמיתית, חובה לבדוק את הרישיונות במאגר המקורי של PaddlePaddle או בגיטהאב של הממיר.

הרישיון המלא בעמוד המודל ↗