GPT
C

camembert-base

קוד פתוח

almanachmit2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • camembert

מודל שפה קומפקטי לצרפתית שמבוסס על ארכיטקטורת RoBERTa. הוא מתאים למי שצריך לחלץ ייצוגים וקטוריים או להשלים מילים בטקסטים בצרפתית בלי לבזבז משאבי חומרה יקרים.

  • 111Mפרמטרים
  • 514טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 940,720הורדות בחודש

מה זה

מדובר במודל ייעודי לשפה הצרפתית עם 111 מיליון פרמטרים ו־12 שכבות, שפותח במקור כגרסה מקומית לארכיטקטורת RoBERTa. הגרסה הזו אומנה על מאגר OSCAR בנפח של 138 גיגה-בייט טקסט, בניגוד לגרסאות מוקטנות יותר של הפרויקט שאומנו על ויקיפדיה או על מדגמים של 4 גיגה-בייט בלבד. המטרה העיקרית שלו היא השלמת מילים מוסתרות במשפט, מה שמאפשר לו להבין את המבנה והתחביר הצרפתי לעומק.

ההבדל המשמעותי לעומת מודלים כלליים באותו גודל נעוץ בטוקנייזר ובהתמקדות הבלעדית בצרפתית. במקום לחלוק את המילון עם עשרות שפות, כל הייצוגים מוקדשים לצרפתית, כולל מילים עם סימנים דיאקריטיים אופייניים. הוא יודע להוציא וקטורים מכל 12 השכבות שלו, מה שמאפשר להשתמש בו כבסיס למשימות סיווג, תיוג ישויות או ניתוח תחבירי.

מתאים ל

  • השלמת מילים מוסתרות

    ניבוי מילים חסרות בתוך משפטים בצרפתית על פי ההקשר התחבירי והסמנטי.

  • חילוץ וקטורים לטקסט

    הפקת אמבדינגס מדויקים בצרפתית מכל אחת מ־12 השכבות לשימוש בסיווג.

  • בסיס למשימות NLP

    אימון שכבות עליונות לזיהוי ישויות או ניתוח סנטימנט על גבי מודל קל משקל.

איפה זה נופל

הוא מוגבל לחלוטין לשפה הצרפתית, כך שאם תשלבו בו עברית או אנגלית תקבלו תוצאות שגויות. בנוסף, חלון ההקשר עומד על 514 טוקנים בלבד, מה שמונע ניתוח של מסמכים ארוכים או חוזים ברצף אחד בלי לחתוך אותם קודם.

המודל אינו מודל שיחה ומיועד למשימות אנליטיות והשלמת מסיכות, לא ליצירת טקסט חופשי. הכרטיס גם מציג גרסה גדולה יותר של 335 מיליון פרמטרים וגרסאות שאומנו על CCNet, כך שאם הביצועים שלו בטקסטים מסוימים אינם מדויקים, תצטרכו לבדוק את הגרסאות המקבילות.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית?

לא, הוא אומן אך ורק על צרפתית והטוקנייזר שלו מותאם לשפה הזו. הזנת טקסט בעברית תגרום לשגיאות או לפירוק שגוי של מילים.

מה ההבדל בינו לבין שאר גרסאות CamemBERT?

גרסה זו מכילה 110 מיליון פרמטרים ואומנה על מאגר OSCAR המלא בנפח 138GB. גרסאות אחרות בפרויקט אומנו על CCNet או על מדגמים מצומצמים יותר של 4GB.

האם הוא מתאים לצ'אטבוט או ליצירת תוכן?

לא, הוא מבוסס על ארכיטקטורת RoBERTa שמיועדת להבנת טקסט והשלמת מילים מוסתרות. הוא אינו מודל יוצר ואינו מסוגל לנהל שיחה.

איך מריצים

כדי להריץ אותו משתמשים בספריית transformers של פייתון דרך CamembertModel או בפייפליין של fill-mask. שוקל 1.3 גיגה-בייט בלבד, כך שלא צריך שרת מיוחד או כרטיס גרפי כבד. כל מעבד מודרני ממוצע או כרטיס מסך בסיסי ביותר מריצים אותו בקלות ובמהירות.

במשקל כזה אין שום סיבה להשתמש ב־API מרוחק או לשלם לספק ענן חיצוני. אתם יכולים להוריד את הקבצים, לטעון אותם לזיכרון של שרת פנימי רגיל, ולהריץ משימות ישירות בתוך התשתית שלכם בלי תלות ברשת ובלי תשלום לפי קריאה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="almanach/camembert-base")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, אחד הרישיונות המתירניים ביותר שיש. אפשר להשתמש בו בחופשיות לפרויקטים מסחריים, לשנות את הקוד, לכוונן אותו על נתונים פנימיים ולהפיץ אותו בתוך מוצר סגור. הדרישה היחידה היא לשמור על הצהרת זכויות היוצרים המקורית והפטור מאחריות של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗