GPT
P

polyglot-ko-1.3b

קוד פתוח

EleutherAIapache-2.02022-09-15

  • transformers
  • pytorch
  • safetensors
  • gpt_neox
  • text-generation

מודל שפה קטן יחסית שמאומן ספציפית על קוריאנית בלבד. הוא מתאים למי שחייב מודל מקומי קל משקל שמבין קוריאנית ולא תלוי ברשת.

  • 1.4Bפרמטרים
  • 2,048טוקנים בהקשר
  • 5.2 GBמשקל הקבצים
  • 3,120הורדות בחודש

מה זה

המודל הזה נבנה מאפס על ידי EleutherAI במטרה לתת מענה לשפה הקוריאנית, תחום שבו רוב מודלי הקוד הפתוח הכלליים מזייפים. הוא אומן על 863 גיגה-בייט של טקסט קוריאני מגוון, שכולל פוסטים בבלוגים, חדשות ופטנטים, אחרי סינון של פרטי זיהוי אישיים כמו תעודות זהות וחשבונות בנק.

במבחני KOBEST רואים בדיוק מה הוא שווה. במשימת COPA, שבודקת היגיון וסיבתיות, הוא מגיע לציון F1 של 0.7196 באפס דוגמאות, שזה גבוה משמעותית ממודל xglm-7.5B הגדול ממנו בהרבה. מצד שני, במשימות של הבנת מילים בהקשר כמו WiC כל המודלים בסדרה מציגים ביצועים שקרובים לניחוש אקראי, כך שלא מדובר בכלי שמבין ניואנסים עמוקים.

מתאים ל

  • השלמת טקסט בקוריאנית

    הוא אומן על 213 מיליארד טוקנים בקוריאנית ויודע להמשיך משפטים בצורה שוטפת.

  • מיון ראשוני של טקסט

    הוא מציג תוצאות טובות במשימות זיהוי רגש וסיבתיות כשנותנים לו דוגמאות בפרומפט.

  • בסיס לאימון ממוקד

    1.4 מיליארד פרמטרים זה גודל נוח מאוד לכוונון עדין על משימות ייעודיות בארגון.

איפה זה נופל

היוצרים מבהירים שהמודל אומן רק על חיזוי הטוקן הבא. הוא יחזיר את מה שהכי סביר סטטיסטית, לא את מה שנכון עובדתית, ולכן הוא נוטה להזיות ולהמצאות. בנוסף, הוא עלול לייצר תוכן פוגעני או לא הולם שמקורו בנתוני האינטרנט שעליהם הוא אומן, כך שאי אפשר לחבר אותו לממשק משתמש בלי שכבת סינון אנושית או אוטומטית.

אותה משפחה

polyglot-ko יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מבין או מייצר עברית?

לא. המודל אומן על דאטה קוריאני בלבד ומכיל אוצר מילים ייעודי לשפה זו. כל ניסיון להזין עברית יניב ג'יבריש או שגיאות.

האם אפשר להשתמש בו ישירות כצ'אטבוט?

לא מומלץ. זה מודל בסיס של השלמת טקסט שלא עבר אימון להוראות, ולכן הוא לא ינהל שיחה אלא ינסה להמשיך את הפרומפט.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.2 גיגה-בייט בפורמט float16, מה שאומר שהוא ירוץ בלי בעיה על כרטיס מסך ביתי בודד עם 8 עד 12 גיגה-בייט זיכרון. טוענים אותו ישירות דרך ספריית transformers עם המחלקה AutoModelForCausalLM בשתי שורות קוד פשוטות.

אם אתם צריכים רק לקרוא טקסט או לייצר כמה משפטים פעם ביום, אין טעם להרים שרת ייעודי בשבילו. לעומת זאת, אם אתם מריצים בדיקות מקומיות או בונים שירות שחייב להישאר אופליין ובתוך הרשת הפרטית, הגודל שלו מאפשר הרצה זולה מאוד.

from transformers import pipeline

pipe = pipeline("text-generation", model="EleutherAI/polyglot-ko-1.3b")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי שום חובה לפתוח את הקוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗