GPT
F

fasttext-language-identification

קוד פתוח

facebookcc-by-nc-4.02023-03-06

  • fasttext
  • text-classification
  • language-identification

סיווג שפה קל משקל שמזהה 217 שפות שונות ישירות על המעבד. פתרון מהיר למי שצריך למיין כמויות טקסט בלי לגעת במאיצים גרפיים.

  • 1.1 GBמשקל הקבצים
  • 447,739הורדות בחודש
  • 280לייקים

מה זה

המודל הזה, שמבוסס על ספריית fastText ושוחרר כחלק מפרויקט NLLB של פייסבוק, נועד לזהות את השפה שבה נכתב טקסט נתון. בניגוד לגרסאות קודמות של הספרייה שכיסו 157 שפות, הגרסה הזו מגיעה לזיהוי של 217 שפות שונות, כולל עברית, ומחזירה תיוג עם רמת ביטחון סטטיסטית לכל ניחוש.

הוא שונה מרוב פתרונות השפה המודרניים בכך שהוא אינו מודל שפה ענק. הוא נשען על ייצוג מילים וקטעי מילים, ומאפשר סיווג טקסטים ארוכים וקצרים כאחד בשבריר שנייה. במקום לבזבז משאבי ענן על מודלי ענק כדי לדעת באיזו שפה המשתמש כתב, הוא עושה את העבודה המדויקת הזו בלבד במינימום משאבים.

מתאים ל

  • ניתוב שפה במערכות שירות

    הוא מזהה מיד 217 שפות שונות על גבי המעבד, ומאפשר להעביר פניות משתמשים לנציג או לתור הנכון.

  • סינון וניקוי דאטה־סטים

    הוא רץ מהר מאוד על גבי מאגרי טקסט גדולים, ועוזר להפריד מסמכים לפי שפה לפני שלבי עיבוד כבדים.

  • מחקר אקדמי לעיבוד שפה

    הוא זמין תחת רישיון חופשי למחקר, ומספק וקטורים איכותיים להשוואה ולסיווג ללא עלויות חומרה מיוחדת.

איפה זה נופל

היוצרים מודים שהמודל עלול להציג הטיות בחיזויים שלו, למרות השימוש במאגרי אימון שנחשבים ניטרליים יחסית. בכרטיס המודל מודגמת הטיה מגדרית ברורה במרחב הווקטורי, למשל בדמיון בין המילים מנכ"ל וגבר לעומת מנכ"ל ואישה. אם הפרויקט שלכם נשען על ניתוח סמנטי עמוק יותר מסיווג פשוט, תצטרכו לבדוק את התוצאות מראש כדי לוודא שאינכם מקבלים החלטות מוטות.

שאלות
נפוצות

האם המודל מזהה עברית בצורה טובה?

האימון כלל טוקניזציה ייעודית לאלפבית עברי בעזרת כלים של פרויקט Europarl, בנוסף לנתונים מתוך ויקיפדיה ו־Common Crawl. הוא תומך בעברית כחלק מ־217 השפות שלו ומסוגל לסווג אותה היטב, אך מומלץ לבדוק אותו על טקסטים קצרים ומעורבים באנגלית כדי לוודא שאינו מתבלבל.

האם אפשר להשתמש במודל הזה בתוך מוצר מסחרי?

לא. הרישיון של הקובץ הזה הוא cc-by-nc-4.0, שמונע כל שימוש מסחרי ישיר או עקיף. אם אתם צריכים פתרון מסחרי, תצטרכו לאמן מודל fastText עצמאי על נתונים משלכם או להשתמש בגרסאות אחרות של המודל ששוחררו תחת רישיונות מתירניים יותר.

איך מריצים

טוענים את הקובץ ישירות באמצעות ספריית fastText בפייתון או מקשרים אותו לפרויקט C++. המודל כולו שוקל 1.1 ג'יגה בייט ורץ ישירות על מעבד רגיל מרובה ליבות, כך שאין שום צורך בכרטיסי מסך, זיכרון גרפי או שרתים ייעודיים. אפשר אפילו לדחוס מודלים מסוג זה בעזרת הכלים של הספרייה כדי שיעבדו על מכשירי קצה וטלפונים ניידים.

הוא מתאים במיוחד לעיבוד מקומי של אלפי מסמכים בשנייה. לפנות ל־API חיצוני במקרה כזה יהיה פשוט בזבוז של כסף וזמני השהיה, כיוון שריצה מקומית על המחשב שלכם תהיה זולה ומהירה בהרבה.

pip install -U huggingface_hub
hf download facebook/fasttext-language-identification

הקבצים

3 קבצים במאגר, 1.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון cc-by-nc-4.0. המשמעות פשוטה: מותר להשתמש בו, לשנות אותו ולחקור אותו רק לצרכים לא מסחריים ובלבד שניתן קרדיט מתאים. אם אתם בונים מוצר בתשלום, חברת הזנק מסחרית או תוכנה ארגונית פנימית, אסור לכם להטמיע את הקובץ הזה במוצר שלכם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗