GPT
O

Orca-2-7b

קוד פתוח

microsoftother2023-11-14

  • transformers
  • pytorch
  • llama
  • text-generation
  • orca

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מיקרוסופט אימנה את המודל הזה על דאטה סינתטי כדי ללמד מודל קטן לחשוב צעד אחר צעד. הוא מיועד למי שרוצה יכולות היקש וחשיבה מתמטית בגודל של שבעה מיליארד פרמטרים.

  • 4,096טוקנים בהקשר
  • 25.1 GBמשקל הקבצים
  • 1,160הורדות בחודש
  • 224לייקים

מה זה

הבסיס כאן הוא מודל פתוח מוכר של מטא, אבל האימון שונה לגמרי. במקום להסתפק בהוראות פשוטות, השתמשו במודלים חזקים כדי לייצר נתונים סינתטיים מורכבים שהעבירו דרך מסנני תוכן. הרעיון היה ללמד מודל קומפקטי לפתור בעיות בהבנת הנקרא, מתמטיקה ותמצות, תחומים שבהם מודלים בגודל כזה בדרך כלל מתקשים מאוד.

התוצאה מתמקדת בפנייה בודדת ומכוונת ספציפית ליכולת היקש. הוא לא עבר אימון התאמה לשיחה מול בני אדם, כך שאין כאן צ'אטבוט מוכן מהקופסה. המטרה שלו היא לשמש בסיס מחקרי שמראה איך דאטה סינתטי איכותי דוחף קדימה ביצועים של מודלים קטנים.

מתאים ל

  • מחקר על דאטה סינתטי

    הוא מציג בפועל איך אימון על פלטים של מודלים אחרים משפר יכולות היקש במודל קטן.

  • פתרון בעיות מתמטיות

    הוא אומן להסיק מסקנות שלב אחרי שלב במענה בודד לשאלות חישוב מורכבות.

  • הבנת הנקרא ותמצות

    הארכיטקטורה שלו מכוונת לעיבוד נתונים קיימים וניתוח טקסטים קצרים ללא צורך בשיחה.

איפה זה נופל

היוצרים מדגישים שהמודל נבנה למחקר בלבד ולא מיועד לשימוש במוצרים. הוא לא עבר תהליכי יישור כמו למידה מחיזוקים, ולכן נוטה להמציא עובדות, להפגין הטיות ולייצר תגובות לא יציבות בתגובה להוראות מערכת שונות. חלון ההקשר מוגבל ל־4,096 טוקנים.

בנוסף, האימון התמקד במצבים שבהם לא נותנים למודל דוגמאות בתוך הפרומפט. בגלל זה הוא לא מרוויח הרבה ממתן דוגמאות מראש, בניגוד לרוב המודלים הגדולים. מיקרוסופט מציינת במפורש שחובה להפעיל מסנני תוכן חיצוניים על הפלטים שלו כדי לעצור תכנים פוגעניים.

אותה משפחה

Orca-2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש בו בתור צ'אטבוט לשירות לקוחות?

לא. המודל לא אומן לשיחה ולא עבר תהליכי יישור מול בני אדם. הוא מיועד למענה בפנייה בודדת ומחייב אימון נוסף כדי לתפקד בשיחה רציפה.

למה הקבצים שוקלים 25.1 גיגה בייט למודל קטן כזה?

המשקלים פורסמו בדיוק מלא של שלושים ושתיים סיביות במקום חצי דיוק. זה דורש זיכרון כפול בעת הטעינה לכרטיס המסך ומחייב חומרה כבדה יותר.

איך מריצים

המשקלים יושבים בפורמט צף מלא ותופסים 25.1 גיגה בייט בדיסק, שזה המון בשביל מודל של שבעה מיליארד פרמטרים. כדי להעלות אותו כמו שהוא לסביבת עבודה עם ספריית טרנספורמרס צריך כרטיס מסך רציני עם זיכרון וידאו של 32 גיגה בייט לפחות. בלי להמיר אותו לחצי דיוק או לכווץ אותו, הוא פשוט לא ייכנס בכרטיסים שולחניים נפוצים.

מי שאין לו תשתית כזאת מקומית או תקציב שרתים, יגלה שעדיף לשלם לפי קריאה לשרותי ענן חיצוניים. המודל מתאים בעיקר למי שמחפש לחקור את המשקלים ישירות בסביבה מבוקרת, ולא לתחזוקת שרת ייעודי רק בשביל משימה נקודתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Orca-2-7b")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון המחקר של מיקרוסופט לצד תנאי השימוש של למא 2. המשמעות פשוטה, מותר להשתמש בו לניסויים, לבדיקות ולמחקר אקדמי בלבד. שימוש מסחרי, שילוב בתוך מוצר פעיל או מכירה של שירות המבוסס עליו אסורים לחלוטין לפי תנאי הרישיון המדווח.

הרישיון המלא בעמוד המודל ↗