GPT
O

Orca-2-13B-GGUF

קוד פתוח

TheBlokeother2023-11-21

  • transformers
  • gguf
  • llama
  • orca
  • orca2

גרסת GGUF מכווצת למודל של מיקרוסופט, שמבוסס על LLaMA-2 ואומן על נתונים סינתטיים כדי לחלץ יכולות היסק גבוהות מנפח של 13 מיליארד פרמטרים. פתרון מתאים למי שרוצה להריץ מודל חשיבה מקומית.

  • 91.9 GBמשקל הקבצים
  • 1,929הורדות בחודש
  • 66לייקים

מה זה

מיקרוסופט בנתה את המודל הזה על בסיס LLaMA-2 עם דגש על פתרון בעיות, הבנת הנקרא, מתמטיקה וסיכום טקסטים במענה יחיד. במקום להגדיל את כמות הפרמטרים, אימנו אותו על נתונים סינתטיים שעברו סינון במערכות Azure במטרה ללמד אותו תהליכי חשיבה יעילים יותר.

המאגר של TheBloke ממיר את המשקלים לפורמט GGUF, מה שמאפשר להריץ אותו דרך llama.cpp וממשקים מבוססי מעבד או כרטיס מסך ביתי. ההבדל המשמעותי מול מודלים רגילים בגודל 13B הוא התמקדות בצעדי חשיבה, אם כי המבנה שלו מותאם בעיקר למענה על שאלה בודדת ולא לניהול שיחות מתמשכות.

מתאים ל

  • פתרון בעיות היסק מקומי

    המודל אומן ספציפית על לוגיקה ומתמטיקה, ומספק מענה לשאלות מורכבות במעבד מקומי ללא חיבור רשת.

  • סיכום טקסט במענה בודד

    התמחות בעיבוד והבנת הנקרא מקלט נתון של משתמש ללא צורך בסבבי שיחה מרובים.

  • מחקר על נתונים סינתטיים

    הערכה ובדיקה כיצד אימון על דאטה מלאכותי משפיע על מודלים קטנים בהשוואה למודלי ענק.

איפה זה נופל

היוצרים מבהירים שהמודל מיועד למחקר בלבד ולא למוצרים פעילים. הוא רגיש מאוד להוראות מערכת שונות, סובל מהזיות ועלול לפלוט הטיות שמקורן בנתוני האימון. בנוסף, בגלל אימון שמתמקד במענה יחיד, מתן דוגמאות בתוך הפרומפט לא משפר את הביצועים שלו כמו במודלים אחרים, ויכולותיו בתחומים שלא כוסו היטב במידע הסינתטי נשארות מוגבלות.

אותה משפחה

Orca-2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את כל הקבצים שמופיעים במאגר?

אין שום סיבה להוריד את 91 הגיגהבייט. המאגר מכיל גרסאות כיווץ שונות לאותו מודל בדיוק, וצריך לבחור רק קובץ אחד שמתאים לזיכרון שלכם, למשל גרסת Q4_K_M.

אפשר להשתמש במודל הזה באפליקציה שאני מוכר ללקוחות?

לא. מיקרוסופט שחררה את המודל תחת רישיון מחקר בלבד, והכרטיס מציין במפורש שהוא לא נועד לשימוש במערכות חיצוניות או מסחריות.

האם המודל ירוץ טוב אם אתן לו דוגמאות בתוך הפרומפט?

לא בהכרח. הכרטיס מציין שהאימון נעשה בעיקר למצבי אפס דוגמאות, ולכן הוא לא מציג את השיפור המקובל שמקבלים ממודלים אחרים כשמספקים להם דוגמאות מראש.

איך מריצים

במקום להוריד את כל המאגר ששוקל מעל 90 גיגהבייט, בוחרים קובץ בודד. לקבלת איזון טוב בין איכות למשאבים, גרסת Q4_K_M שוקלת 7.87 גיגהבייט ודורשת 10.37 גיגהבייט זיכרון פנוי במעבד, או כרטיס מסך עם זיכרון תואם כדי לפרוק אליו שכבות עם הדגל ngl. אם המשאבים מוגבלים אפשר לרדת לגרסאות 3 ביט, ולדיוק מרבי יש קבצי 5 ו־6 ביט שלוקחים יותר מ־11 גיגהבייט זיכרון.

אפשר להריץ אותו ישירות מטרמינל דרך llama.cpp, בתוכנות שולחניות כמו LM Studio או בסקריפט פייתון עם ctransformers. הרצה עצמית שווה את המאמץ אם אתם חייבים שהמידע יישאר מקומי על הברזלים שלכם. אם אין לכם חומרה ייעודית ואין בעיית פרטיות, פנייה ל־API חיצוני תחסוך את כאב הראש של ניהול זיכרון ומהירות דגימה נמוכה במעבד.

ollama run hf.co/TheBloke/Orca-2-13B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד והמשקלים שחררו תחת רישיון המחקר של מיקרוסופט לצד תנאי הרישיון של LLaMA 2 מבית מטא. הרישיון אוסר על שימוש מסחרי ומגביל את המודל לצרכי מחקר והערכה בלבד, כך שלא ניתן לשלב אותו באפליקציות מסחריות או למכור שירותים המבוססים עליו.

הרישיון המלא בעמוד המודל ↗