GPT
C

chinese-roberta-wwm-ext-large

קוד פתוח

hflapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

מודל שפה ייעודי לסינית בשיטת מיסוך מילים שלמות. הוא מתאים למי שבונה משימות הבנת שפה בסינית וצריך מודל בגודל 24 שכבות.

  • 512טוקנים בהקשר
  • 3.6 GBמשקל הקבצים
  • 11,694הורדות בחודש
  • 231לייקים

מה זה

מדובר במודל שמיישם את שיטת Whole Word Masking עבור טקסטים בסינית, ומבוסס על ארכיטקטורת BertForMaskedLM של גוגל עם 24 שכבות. במקום להסתיר תווים בודדים כמו ב־BERT רגיל, הוא מסתיר מילים שלמות בשלב האימון המקדים. זה קריטי בסינית כי מילה בנויה לרוב מחיבור של מספר סימניות, וכך המודל נאלץ להבין את המשמעות הכוללת ולא רק לחזות תו בודד מתוך צירוף ברור מאליו.

הוא מיועד למשימת fill-mask, כלומר השלמת טוקנים חסרים בתוך טקסט נתון. מעבר להשלמת מילים, מפתחים לוקחים מודלים כאלה כבסיס ל־fine-tuning של משימות סיווג, זיהוי ישויות או חילוץ מידע בסינית. היוצרים מדגישים בתיעוד שצריך להשתמש בפונקציות Bert הרגילות ב־transformers כדי לטעון אותו, למרות השם שמזכיר RoBERTa.

מתאים ל

  • השלמת מילים בסינית

    חיזוי והשלמת מילים שלמות החסרות בטקסט סיני, בדיוק המטרה שלשמה אומן.

  • בסיס לסיווג טקסט

    אימון נוסף למשימות מיון טקסטים וניתוח סנטימנט בסינית על בסיס 24 שכבות.

  • חילוץ ישויות ומבנים

    מודל בסיס לזיהוי ישויות בתוך טקסט סיני תחת חלון של 512 טוקנים.

איפה זה נופל

הוא מוגבל לחלון הקשר קצר של 512 טוקנים בלבד, כך שטקסטים ארוכים כמו מסמכים משפטיים או מאמרים תצטרכו לחתוך מראש. בנוסף, הוא תומך אך ורק בסינית, ואין לו שום יכולת להתמודד עם עברית או אנגלית מעבר לטוקנים בסיסיים. אם אתם מחפשים מודל שמייצר טקסט חופשי, תשובות ארוכות או שיחה, זה לא הכלי המתאים, כי הוא בנוי להשלמת מסכות בלבד ולא ליצירה רציפה.

שאלות
נפוצות

איך טוענים את המודל בקוד אם השם שלו מכיל RoBERTa?

היוצרים מציינים במפורש להשתמש בפונקציות של Bert מתוך transformers ולא בפונקציות של RoBERTa, מכיוון שהארכיטקטורה המוגדרת שלו היא BertForMaskedLM.

האם המודל מתאים לטקסטים בעברית או באנגלית?

לא, המודל מוגדר לשפה הסינית בלבד. כל שימוש בטקסטים בשפות אחרות יניב תוצאות שגויות או כשלים בפירוק הטוקנים.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות המחלקות של Bert, בדיוק לפי ההנחיה בתיעוד. קבצי המשקלים תופסים 3.6 גיגה־בייט, כך שכדי להריץ אותו להסקה בצורה סבירה תצטרכו כרטיס מסך עם לפחות 6 עד 8 גיגה־בייט של זיכרון וידאו. אם אתם מתכננים לעשות עליו fine-tuning, תצטרכו כרטיס חזק יותר כדי להחזיק את 24 השכבות והגרדיאנטים.

אם אין לכם שרת עם GPU זמין ואתם צריכים רק שאילתות בודדות, פנייה לפתרון ענן מנוהל תהיה פשוטה יותר מלהחזיק תשתית כבדה למודל כזה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="hfl/chinese-roberta-wwm-ext-large")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון apache-2.0. הרישיון הזה מתיר שימוש חופשי כולל שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך המוצר שלכם. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗