GPT
B

bert-base-chinese-ner

קוד פתוח

ckiplabgpl-3.02022-03-02

  • transformers
  • pytorch
  • jax
  • bert
  • token-classification

מודל ייעודי לזיהוי ישויות בסינית מסורתית. הוא מתאים למי שמעבד טקסטים מטייוואן או הונג קונג וצריך חילוץ שמות ומונחים בלי לשבור את הראש על התאמות.

  • 512טוקנים בהקשר
  • 776 MBמשקל הקבצים
  • 107,486הורדות בחודש
  • 134לייקים

מה זה

מדובר במודל מבוסס ארכיטקטורת BERT שמיועד לסיווג טוקנים בטקסט סיני, בדגש על סינית מסורתית. בעוד שרוב מודלי השפה בסינית מתמקדים בסינית מפושטת של סין היבשתית, הצוות של CKIP כיוון ישירות לאוצר המילים והכתב המסורתי. הוא בנוי מ־12 שכבות ומבצע משימות כמו זיהוי שמות אנשים, מקומות וארגונים ישירות מתוך הרצף.

הוא מיועד להרצה מקומית באמצעות ספריית transformers, בלי תלות בתשתיות ענן חיצוניות. אם הטקסטים שלכם מגיעים ממקורות שכותבים בסינית מסורתית, מודלים כלליים נוטים לפספס שם ניואנסים וחלוקת מילים, וזה בדיוק המקום שבו מודל כזה נכנס לפעולה.

מתאים ל

  • חילוץ ישויות מטקסט בסינית

    זיהוי שמות, מקומות וארגונים במסמכים הכתובים בסינית מסורתית בצורה מדויקת.

  • טיוב דאטה לאינדקס וחיפוש

    תיוג ישויות בטקסטים לפני הכנסתם למנוע חיפוש כדי לשפר תוצאות שאילתות.

  • עיבוד מקדים למאגרי מידע

    פירוק טקסט גולמי לרכיבים בעלי משמעות לטובת בניית גרף ידע מקומי.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שאי אפשר לזרוק עליו מסמכים שלמים בלי לחתוך אותם לחתיכות קטנות קודם. מעבר לזה, המודל מתמקד אך ורק בשפה הסינית ובמשימת סיווג טוקנים. אין כאן יכולות שיחה, סיכום או הבנת הקשר רחב. כרטיס המודל כמעט ולא חושף מדדי ביצועים או פירוט על סוגי הישויות המדויקים שהוא אומן עליהם, אז תצטרכו לבדוק בעצמכם על הדאטה שלכם לפני שמחברים אותו למערכת פעילה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית או באנגלית?

לא. המודל אומן ספציפית על סינית ומיועד לשפה הזו בלבד. הרצה על שפות אחרות תניב תוצאות שגויות או חסרות ערך.

האם הוא מתאים לטקסטים ארוכים כמו מאמרים או ספרים?

לא באופן ישיר. המגבלה הקשיחה היא 512 טוקנים, ולכן תצטרכו לפרק את הטקסט למשפטים או פסקאות קצרות ולעבד כל חלק בנפרד.

איך מריצים

המשקל הכולל של הקבצים עומד על 776 מגהבייט, כך שלא צריך מפלצת חומרה כדי להריץ אותו. מעבד רגיל יספיק לבדיקות ולעיבוד בקצב נמוך, אבל אם אתם מתכננים לעבד כמויות גדולות של טקסט בזמן אמת, כרטיס מסך בסיסי יחסוך לכם צוואר בקבוק.

בקוד עצמו יש הנחיה ברורה מהיוצרים: חובה להשתמש ב־BertTokenizerFast ולא ב־AutoTokenizer הרגיל, יחד עם מודל הבסיס bert-base-chinese כדי שהטוקניזציה תעבוד נכון. אם אתם צריכים רק קריאה מזדמנת פעם ביום, שירותי צד שלישי יחסכו תחזוקה, אבל בנפח עבודה קבוע המשקל הנמוך הופך הרצה עצמאית לפשוטה ומשתלמת.

from transformers import pipeline

pipe = pipeline("token-classification", model="ckiplab/bert-base-chinese-ner")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 776 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא GPL 3.0, וזה משהו שחייבים לשים אליו לב. מותר להשתמש בו ולשנות אותו, אבל אם תפיצו מוצר שכולל את המודל או נגזר ממנו, תצטרכו לשחרר את כל קוד המקור תחת אותו רישיון. לשימוש פנימי זה לרוב לא מפריע, אבל להפצה מסחרית סגורה זה עשוי להוות בעיה משפטית.

הרישיון המלא בעמוד המודל ↗