GPT
G

glotlid

קוד פתוח

cis-lmuother2023-10-19

  • fasttext
  • text-classification
  • language-identification
  • aah
  • aai

זיהוי שפה מדויק במיוחד שמכסה מעל 2,000 שפות וניבים שונים. פתרון מבוסס פאסט-טקסט שמתאים למי שממיין טקסטים נדירים או עובד עם מאגרי ענק.

  • 6.0 GBמשקל הקבצים
  • 233,055הורדות בחודש
  • 101לייקים

מה זה

אם אתם צריכים לזהות באיזו שפה נכתב טקסט מסוים, רוב הכלים הקיימים ייעצרו בכמה עשרות או מאות שפות מוכרות. הפרויקט הזה הולך הרבה מעבר, עם תמיכה ביותר מ־2,100 תוויות שונות שמשלבות קודי שפה בני שלוש אותיות יחד עם מערכת הכתב שלהן. הוא פותח באוניברסיטת מינכן במיוחד כדי לתת מענה לשפות בעלות משאבים דלים, כאלה שמודלים סטנדרטיים פשוט מתעלמים מהן או מזהים בטעות כג'יבריש.

בגרסה השלישית שלו, שנקראת V3, החוקרים ניקו דאטה רועש מגרסאות קודמות, הסירו שפות-על רחבות מדי כדי לדייק, והוסיפו תוויות לטקסטים לא מזוהים או נטולי שפה. זה כלי קלאסי לסיווג טקסט שנשען על Fasttext הוותיקה והמוכחת, בלי רשתות נוירונים כבדות או ארכיטקטורות טרנספורמר מיותרות למשימה הזו.

מתאים ל

  • סינון וניקוי מאגרי מידע

    זיהוי ומיון יעיל של מסמכים באלפי שפות שונות מתוך סריקות רשת ענקיות.

  • ניתוב פניות תמיכה

    זיהוי מהיר של שפת הפנייה בטקסט חופשי כדי לנתב אותה לנציג המתאים.

  • מחקר בלשני וטקסטים נדירים

    תיוג שפות וניבים מקומיים שספריות זיהוי סטנדרטיות לא מכירות כלל.

איפה זה נופל

אם אתם צריכים לזהות רק עשר שפות נפוצות כמו אנגלית, ספרדית או ערבית, המודל הזה כנראה מסורבל מדי עבורכם. עם מעל 2,000 תוויות, יש סיכון לטעויות בזיהוי שפות קרובות או ניבים דומים, במיוחד בטקסטים קצרים של מילים בודדות. בנוסף, החוקרים עצמם נאלצו להוציא גרסאות מתקנות כדי לסנן רעשים ותיוגים שגויים מגרסאות קודמות, מה שאומר שבדאטה קיצוני או לא מוכר תמיד כדאי לבדוק מדגם ידני לפני שמסתמכים עליו בפרודקשן.

שאלות
נפוצות

האם המודל דורש כרטיס מסך כדי לפעול בזמן אמת?

לא. המודל מבוסס על Fasttext ורץ מצוין ומהר מאוד על גבי מעבד רגיל לחלוטין. הוא תופס זיכרון עבודה בהתאם לגודל הקובץ אבל לא צריך שום תשתיות GPU יקרות.

באיזו גרסה של המודל כדאי להשתמש?

מומלץ להשתמש בגרסה V3, שאליה מצביע הקובץ model.bin כברירת מחדל. גרסה זו כוללת תיקוני שגיאות, ניקוי רעשים שזוהו בגרסאות קודמות ותמיכה במספר השפות הגדול ביותר.

איך מריצים

הריצה מתבצעת ישירות דרך ספריית fasttext בפייתון. מורידים את קובץ המשקלים, טוענים אותו עם פקודת load_model ומריצים חיזוי פשוט על המחרוזת. מכיוון שמדובר בקובץ בינארי של Fasttext, אין שום צורך בכרטיס מסך ייעודי. מעבד סביר של מחשב נייד או שרת פשוט יריצו את הבדיקות האלה באלפיות שניה לכל משפט.

סך כל הקבצים במאגר שוקל 6 גיגה-בייט, בעיקר כי הוא מכיל גם את הגרסאות הקודמות model_v1 ו־model_v2. הקובץ העדכני model.bin מפנה ישירות לגרסה השלישית. בגלל המהירות והפשטות של הספרייה הזו, כמעט אין היגיון לשלם ל־API חיצוני על זיהוי שפה, אלא אם אתם ממש לא רוצים להחזיק קובץ מודל בזיכרון של השרת שלכם.

pip install -U huggingface_hub
hf download cis-lmu/glotlid

הקבצים

7 קבצים במאגר, 6.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 בתוספת הערות משפטיות בקובץ הייעודי. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הקוד והמשקלים, אבל חובה לבדוק את קובץ ה־LICENSE במאגר כדי לוודא שאין תנאים מגבילים ספציפיים על חלקי הדאטה ששימשו לאימון.

הרישיון המלא בעמוד המודל ↗