GPT
R

roberta-base-finetuned-cluener2020-chinese

קוד פתוח

uerרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

זהו מודל שמזהה ישויות בטקסטים בסינית על בסיס ארכיטקטורת RoBERTa. הוא עבר התאמה על דאטה־סט CLUENER2020 ומיועד למי שמעבד שפה סינית מקומית.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 4,119הורדות בחודש
  • 49לייקים

מה זה

מדובר במודל לסיווג טוקנים שעבר כוונון ממוקד למשימת זיהוי ישויות (NER) בסינית בלבד. הבסיס שלו הוא מודל RoBERTa בעל 12 שכבות, שאומן באמצעות ספריית UER-py על תשתית Tencent Cloud. הדאטה ששימש לאימון הוא ערכת הנתונים CLUENER2020, כאשר היוצרים השתמשו רק בסט האימון שלה כדי לבצע כוונון לאורך חמישה מחזורים.

הוא מיועד לתת פתרון נקודתי לחילוץ שמות, ארגונים ומונחים מתוך טקסט סיני, ישירות דרך הספרייה הסטנדרטית של transformers. בניגוד למודלים רב־לשוניים כלליים, ההתמקדות המלאה כאן היא בשפה הסינית ובסטנדרט שנקבע באותו בנצ'מרק, בלי לנסות לתמוך בשפות נוספות.

מתאים ל

  • חילוץ ישויות מטקסט סיני

    זיהוי אוטומטי של שמות אנשים וארגונים במסמכים הכתובים בסינית.

  • עיבוד נתונים ב־CLUENER

    תאימות מלאה למבנה התיוג של הדאטה־סט CLUENER2020 ללא צורך בהתאמות נוספות.

  • הרצה מקומית ומאובטחת

    גודל קובץ של 1.1 ג'יגה שמאפשר עיבוד נתונים רגישים על שרת מקומי בלי אינטרנט.

איפה זה נופל

הבעיה המרכזית היא חוסר מוחלט בפרטים על הביצועים. כרטיס המודל לא מציג ציוני F1, אחוזי דיוק או תוצאות על סט הבדיקה, למרות שאימנו אותו מול סט פיתוח. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שטקסטים ארוכים דורשים פיצול ידני. אם יש לכם טקסטים בעברית, באנגלית או בכל שפה אחרת, הוא פשוט לא יעבוד עליהם כי הוא הותאם רק לסינית.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

לא. המודל אומן ונבדק על אוצר מילים וטקסטים בסינית בלבד. הוא לא יזהה ישויות בשפות אחרות וניסיון להריץ עליו עברית יניב שגיאות או פלט חסר משמעות.

איך אפשר לדעת מה רמת הדיוק שלו?

היוצרים לא פרסמו מדדי ביצועים או תוצאות מספריות. כדי להבין אם הוא מתאים לצרכים שלכם, תצטרכו להוריד אותו ולמדוד את הדיוק בעצמכם על נתוני המבחן שלכם.

איך מריצים

בזכות משקל קבצים של 1.1 ג'יגה־בייט וארכיטקטורה קלאסית של BertForTokenClassification, לא צריך חומרה ייעודית כבדה. מעבד מודרני ממוצע יריץ אותו בלי בעיה עבור משימות אצווה קטנות, וכרטיס מסך בסיסי יספיק למהירות גבוהה בהרבה ולעיבוד בכמויות גדולות יותר. טוענים אותו ישירות דרך פייפליין לסיווג טוקנים בספריית transformers.

אם אתם צריכים לנתח כמויות ענק של טקסטים בשוטף, שמירה שלו בתוך השרת שלכם תהיה זולה ופשוטה משמעותית מתשלום לפי קריאה ל־API חיצוני. לעומת זאת, אם השימוש בסינית הוא מקרה קצה נדיר במוצר שלכם, הקמה ותחזוקה של מודל נפרד בשביל שפה אחת עשויה להיות מיותרת.

from transformers import pipeline

pipe = pipeline("token-classification", model="uer/roberta-base-finetuned-cluener2020-chinese")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון שימוש. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין הרשאה מפורשת להריץ, לשנות או להפיץ את המשקולות, בטח שלא בתוך מוצר מסחרי. לפני שמשלבים אותו במערכת פעילה, צריך לבדוק מול המפתחים מה תנאי השימוש.

הרישיון המלא בעמוד המודל ↗