GPT
Y

Yi-6B-Chat

קוד פתוח

01-aiapache-2.02023-11-22

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסת צ'אט קלה יחסית שנבנתה על ארכיטקטורת Llama ואומנה על 3 טריליון טוקנים. מתאימה למי שרוצה להריץ שיחה דו־לשונית באנגלית ובסינית על חומרה מקומית נגישה.

  • 6.1Bפרמטרים
  • 4,096טוקנים בהקשר
  • 11.3 GBמשקל הקבצים
  • 29,864הורדות בחודש

מה זה

המודל הזה מגיע מבית 01-ai ומציע מודל שיחה מכוונן עם 6.1 מיליארד פרמטרים. הבסיס שלו עבר אימון מאפס על קורפוס ענק של 3T טוקנים, תוך התמקדות בשפות אנגלית וסינית. הוא משתמש במבנה המוכר של Llama, מה שאומר שהוא מתחבר בקלות לכל התשתיות והספריות הקיימות בלי לכתוב קוד ייעודי.

בשונה ממודלים כבדים יותר בסדרה, הגרסה הזו מיועדת בעיקר למחקר, פיתוח ושימוש אישי. ברירת המחדל של חלון ההקשר עומדת על 4,096 טוקנים, נתון בסיסי למדי שמתאים למשימות קצרות וממוקדות ולא לקריאת מסמכים ארוכים.

מתאים ל

  • בוט שיחה מקומי וקל

    צריכת הזיכרון הנמוכה מאפשרת להרים עוזר שיחה מהיר על מחשב אישי בלי תלות ברשת.

  • תרגום אנגלית וסינית

    הוא אומן על קורפוס דו־לשוני רחב ומתאים למשימות הבנה וטקסט בשתי השפות האלו.

  • בסיס לאימון Reinforcement

    התשובות שלו מגוונות מאוד בגלל היעדר RL, מה שהופך אותו למועמד טוב להמשך אימון.

איפה זה נופל

היוצרים מציינים בפירוש שהמודל אומן בשיטת SFT בלבד ללא שלב יישור עם משוב אנושי, מה שמייצר תגובות מגוונות אך מגביר הזיות וחוסר עקביות. שגיאות קטנות נוטות להצטבר בשרשראות חשיבה ארוכות, והוא לא מצטיין במתמטיקה מורכבת לעומת דגמי ה־9B וה־34B בסדרה. בנוסף, חלון של 4,096 טוקנים קצר מאוד לשימושים מודרניים, והאימון הדו־לשוני מתרכז באנגלית וסינית, כך שעברית לא מקבלת כאן שום יתרון מיוחד.

אותה משפחה

Yi יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבוסס על המשקלים של Llama?

לא. הארכיטקטורה זהה לחלוטין למבנה של Llama כדי לשמור על תאימות לספריות פיתוח, אבל המשקלים אומנו מאפס על ידי 01-ai ולא נלקחו ממטא.

האם הוא מתאים לניתוח קבצי PDF ארוכים?

לא בגרסה הזו. חלון ההקשר כאן מוגבל ל־4,096 טוקנים, ולמשימות של טקסט ארוך עדיף לבחור בגרסאות ה־200K של הסדרה.

איך מריצים

הקבצים שוקלים 11.3 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך ביתי בודד עם 16GB VRAM יחזיק אותו בקלות. אם אתם מוגבלים בזיכרון, קיימות גרסאות קוונטיזציה של 4 ביט ו־8 ביט שרצות מצוין גם על חומרה צנועה יותר או דרך llama.cpp על מעבדי אפל.

ההרצה מתבצעת ישירות דרך ספריית transformers הרגילה של פייתון עם שימוש בתבנית הצ'אט המובנית. אם המטרה היא להרים שירות מהיר בלי לנהל שרתים וכרטיסים, אפשר לפנות ישירות ל־API שזמין דרך Replicate או השירות הרשמי.

from transformers import pipeline

pipe = pipeline("text-generation", model="01-ai/Yi-6B-Chat")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗