GPT
Y

Yi-9B

קוד פתוח

01-aiapache-2.02024-03-01

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-generation-inference

מודל בסיס של 8.8 מיליארד פרמטרים שנועד לתת מענה חזק בקוד ובמתמטיקה. הוא פונה למי שמחפש מודל קומפקטי יחסית אבל צריך דיוק בחשיבה כמותית מעבר למה שקיים בגודל 7B רגיל.

  • 8.8Bפרמטרים
  • 4,096טוקנים בהקשר
  • 16.5 GBמשקל הקבצים
  • 8,984הורדות בחודש

מה זה

מדובר במודל שפותח על בסיס ארכיטקטורת LlamaForCausalLM עם 48 שכבות, ונוצר כהמשך אימון ישיר על גבי גרסת ה־6B של אותה סדרה באמצעות 0.8T טוקנים נוספים. המטרה בהרחבה הזו הייתה לחזק במיוחד יכולות תכנות, פתרון בעיות מתמטיות, הבנת הנקרא והסקה הגיונית. הנתונים שעליהם אומן מגיעים עד יוני 2023 ומבוססים על קורפוס רב לשוני רחב, עם התמקדות חזקה באנגלית ובסינית.

המשקל שלו עומד על כמעט 9 מיליארד פרמטרים, כלומר נקודת אמצע בין משפחת ה־7B הנפוצה לבין מודלים כבדים בהרבה. המפתחים מציגים אותו כחלופה עדיפה במבחני ביצועים מול דגמים כמו Mistral-7B או Gemma-7B במשימות חשיבה וקוד. עם זאת, צריך לזכור שזהו מודל בסיס ולא מודל שיחה, כך שהוא מייצר המשכי טקסט ולא מגיע עם התנהגות מובנית של עוזר אינטראקטיבי.

מתאים ל

  • אימון ייעודי למשימות קוד

    בסיס ממוקד להמשך כוונון אישי בזכות חיזוקים מוקדמים בלוגיקה ובשפות תכנות.

  • פתרון בעיות כמותיות

    מתאים להרצה מקומית של ניתוח מתמטי ומשימות חישוב ללא תלות ברשת חיצונית.

  • השלמת טקסט דו לשונית

    יעיל במיוחד ליצירת תוכן ומבני נתונים באנגלית ובסינית על גבי חומר קיים.

איפה זה נופל

זהו מודל בסיס שלא עבר אימון הנחיות או התאמת שיחה, ולכן הוא נוטה להשלים טקסט במקום לענות ישירות לשאלות. חלון ההקשר כאן מוגבל ל־4,096 טוקנים בלבד, מה שמקשה על עבודה עם קבצי קוד גדולים או מסמכים ארוכים ללא שדרוג לגרסאות ההקשר המורחב. בנוסף, נתוני האימון מעודכנים רק עד יוני 2023, והמודל אינו כולל מנגנוני סינון ובטיחות מובנים מפני פליטת שגיאות והזיות.

אותה משפחה

Yi יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לצ'אט ישיר מול משתמשים?

לא באופן טבעי. מדובר במודל בסיס שנועד להשלמת טקסט ולא עבר supervised fine-tuning לשיחה. אם תשאלו אותו שאלה הוא עשוי להמשיך לייצר שאלות דומות במקום לספק תשובה, ולכן נדרש כוונון נוסף או שימוש בגרסת צ'אט.

איך הוא מתמודד עם טקסטים ארוכים?

הגרסה הזו מוגבלת לחלון הקשר של 4,096 טוקנים בלבד. לעיבוד מסמכים כבדים או ספריות קוד שלמות עדיף לבחור בגרסת ה־200K של הסדרה, שמיועדת בדיוק לתרחישים של נפח קריאה גדול.

איך מריצים

כדי להריץ את המודל במלואו בדיוק המקורי של bfloat16 צריך כרטיס מסך עם לפחות 20GB עד 24GB של זיכרון ייעודי, כאשר קובצי המשקולות לבדם תופסים 16.5GB. כרטיס בודד כמו RTX 3090 או RTX 4090 יספיק לטעינה ולהסקה בסיסית של המשקולות הגולמיות דרך ספריית transformers.

אם אין לכם חומרה כזו מקומית, עבודה עם llama.cpp על גבי גרסאות מכווצות היא פתרון מעשי יותר להרצה על מחשבים אישיים. פנייה ל־API חיצוני עדיפה בעיקר אם אתם מחפשים מענה מידי ולא מעוניינים להשקיע משאבים בכוונון עדין של מודל בסיס או בתחזוקת שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="01-ai/Yi-9B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0 מלא. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והמשקולות, שילוב במוצרים סגורים והפצה מחדש. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והעתק של תנאי הרישיון המקוריים בכל הפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗