GPT
C

canine-c

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • canine
  • feature-extraction

מעבד שפה שעובד ישירות על תווים וקוד יוניקוד בלי טוקנייזר רגיל. הבחירה המתאימה כשנמאס לכם להתעסק עם מילונים שנשברים בשפות שונות או בטקסט מלא שגיאות כתיב.

  • 132Mפרמטרים
  • 16,384טוקנים בהקשר
  • 1008 MBמשקל הקבצים
  • 137,328הורדות בחודש

מה זה

גוגל אימנו את המודל הזה על בסיס נתונים של 104 שפות מתוך ויקיפדיה, באותו סגנון של מודלי שפה מוקדמים. השוני המרכזי כאן הוא ביטול מוחלט של מנגנוני פירוק המילים המקובלים, כמו וורדפיס או סנטנספיס. במקום להסתמך על רשימת מילים קבועה מראש שמתקשה עם תווים מיוחדים או סלנג, הוא מקבל פשוט ערכי יוניקוד ישירים של כל תו בטקסט.

בגרסה הזו, שנקראת ספציפית עם סיומת סי, האימון התבצע באמצעות חיזוי תווים שהוסתרו בצורה אוטורגרסיבית, יחד עם משימה של זיהוי רצף בין משפטים. זה מייצר ייצוג וקטורי שמתאים במיוחד לחילוץ מאפיינים מטקסטים רב לשוניים, בלי החשש מטוקנים לא מוכרים שקוטעים את ההבנה באמצע הקריאה.

מתאים ל

  • סיווג טקסט רב-לשוני

    מפיק וקטורים אחידים ל־104 שפות ישירות מתווי יוניקוד, בלי תלות במילון מונחים מוגבל.

  • טיפול בטקסטים מלוכלכים

    מתמודד היטב עם שגיאות הקלדה, תוכן מרשתות חברתיות וסלנג בלי לייצר טוקנים חסרים.

  • חילוץ מאפיינים לאימון מסווג

    משמש בסיס יציב וקל משקל להרצת שכבת קלסיפיקציה מקומית על נתוני הארגון שלכם.

איפה זה נופל

זה לא כלי ליצירת טקסט חדש, צ'אט או כתיבת קוד, אלא אנקודר בלבד. הכרטיס מבהיר במפורש שהוא מיועד למשימות כמו סיווג טקסט או מענה על שאלות, ועדיף להשתמש בו אחרי פיין-טיונינג למשימה מוגדרת. בנוסף, למרות שחלון ההקשר עומד על 16,384 יחידות, צריך לזכור שכל תו בודד תופס יחידה אחת. טקסט שאורכו אלפי מילים מתמלא מהר מאוד לעומת מודלים שסופרים מילים שלמות, כך שהאורך בפועל קצר בהרבה ממה שנראה על הנייר.

שאלות
נפוצות

איך הוא מתמודד עם עברית אם הוא לא משתמש במילון מילים?

הוא מקבל ישירות את מספרי היוניקוד של האותיות בעברית, בדיוק כמו בכל שפה אחרת. מכיוון שהוא אומן על מאגר ויקיפדיה הרב לשוני שכולל עשרות שפות, הוא מסוגל לחלץ ייצוג משמעותי גם בלי טוקנייזר ייעודי לעברית.

האם המודל יודע לייצר תשובות כמו צ'אטבוט?

לא. הארכיטקטורה שלו מיועדת להבנת טקסט ולהפקת וקטורים בלבד, בדומה למודלי ברט. אם אתם צריכים מחולל טקסט, תצטרכו לחפש מודלים אחרים שמתמחים ביצירת תוכן.

איך מריצים

ההרצה פשוטה מאוד ומתבצעת מקומית דרך ספריית הטרנספורמרס של פייתון. המודל שוקל סביב ג'יגה בייט בודד ומחזיק 132 מיליון פרמטרים, כך שכל כרטיס מסך בסיסי או אפילו מעבד רגיל יריצו אותו בלי מאמץ מיוחד ובלי צורך בשרתים כבדים.

אין שום סיבה לחפש שירות ענן או אירוח חיצוני כדי לחלץ ממנו מאפיינים. אתם טוענים אותו ישירות בקוד, מעבירים לו מחרוזות גולמיות, והוא מייצר את הווקטורים במקום. ההכנה היחידה שהקלט דורש היא בעצם המרת תווים למספרים בעזרת פונקציית היוניקוד המובנית בשפה.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="google/canine-c")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 1008 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון אפאצ'י שתיים אפס מאפשר שימוש מסחרי חופשי לחלוטין. אתם יכולים לשלב אותו באפליקציות שלכם, לערוך את הקוד ולהפיץ אותו, כל עוד אתם משאירים את הצהרת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗