GPT
O

Orca-2-7B-GGUF

קוד פתוח

TheBlokeother2023-11-21

  • transformers
  • gguf
  • llama
  • orca
  • orca2

גרסת קוונטיזציה של מודל המחקר מבית מיקרוסופט, שמבוסס על LLaMA-2 ומכוון להסקה לוגית. הוא רץ מקומית על מעבד או כרטיס מסך בסיסי ומתאים למשימות הבנה ותמצות.

  • 47.7 GBמשקל הקבצים
  • 1,363הורדות בחודש
  • 56לייקים

מה זה

מיקרוסופט אימנה את הדגם הזה על גבי LLaMA-2 באמצעות דאטה סינתטי שעבר סינון קפדני, במטרה לחזק יכולות חשיבה והסקה בלי לנפח את מספר הפרמטרים. התוצאה כאן נארזה מחדש בפורמט GGUF בידי TheBloke, מה שמאפשר להריץ אותו ישירות דרך כלי קוד פתוח כמו llama.cpp.

הייעוד העיקרי שלו הוא מענה בסיבוב בודד לשאלות שדורשות הבנת הנקרא, תמצות טקסט ופתרון בעיות בחשבון. בניגוד למודלים מקבילים של שבעה מיליארד פרמטרים שמתפזרים על כתיבה יצירתית, הדגש פה הושם על ביצועים חזקים במיוחד בתנאי אפס דוגמאות, מתוך כוונה לבחון איך מודל קטן מתמודד עם לוגיקה.

מתאים ל

  • תמצות מסמכים מקומי

    סיכום טקסטים ארוכים והפקת נקודות עיקריות בריצה מקומית, בלי לשלוח מידע רגיש לשרתים חיצוניים.

  • הבנת הנקרא ושאילתות

    מענה מדויק על שאלות לוגיות המבוססות על קטע נתון בפרומפט בודד.

  • פתרון בעיות מתמטיות

    ביצוע חישובים והסקה מתמטית פשוטה הדורשים פירוק המשימה לשלבים.

איפה זה נופל

יוצרי המודל במיקרוסופט מגדירים אותו ככלי למטרות מחקר בלבד ומזהירים במפורש שלא להשתמש בו במוצרים סופיים. הוא מיועד למענה בסיבוב אחד ולא לשיחה מתמשכת, והוא לא מציג את השיפור המצופה כאשר מזינים לו מספר דוגמאות בפרומפט. כמות התוכן והדיוק תלויים מאוד בהוראות המערכת שתגדירו, והוא נוטה להזיות כאשר שואלים אותו על עובדות שלא מבוססות ישירות על הטקסט שסיפקתם.

אותה משפחה

Orca-2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לשלב את המודל בבוט שירות לקוחות בעסק?

לא. מיקרוסופט שחררה את המודל תחת רישיון מחקר בלבד, והוא אינו מורשה לשימוש מסחרי. בנוסף, הוא אומן למענה בפעימה אחת ולא לניהול שיחה רציפה, וחסרים לו מנגנוני סינון תוכן עצמאיים.

איזה קובץ הכי כדאי להוריד מתוך כל הרשימה?

הקובץ המאוזן ביותר הוא orca-2-7b.Q4_K_M.gguf. הוא שומר על רמת דיוק טובה מול המודל המקורי, שוקל קצת מעל 4 גיגה בייט, ורץ בצורה חלקה כמעט על כל מחשב מודרני בלי לחנוק את הזיכרון.

איך מריצים

אין שום צורך בחוות שרתים כדי להריץ את הקבצים האלה. גרסת ברירת המחדל המומלצת היא Q4_K_M, ששוקלת 4.08 גיגה בייט ודורשת בערך 6.58 גיגה בייט של זיכרון עבודה אם מריצים אותה על המעבד בלבד, או כרטיס מסך פשוט עם 6 עד 8 גיגה בייט זיכרון כדי לפרוק אליו את השכבות. אם יש לכם חומרה חזקה יותר אפשר ללכת על Q5_K_M או Q6_K, אבל לא כדאי לרדת לגרסאות 2 או 3 ביטים כי הפגיעה באיכות התשובות מורגשת מיד.

מריצים אותו בקלות דרך כלי שולחן עבודה כמו LM Studio, ממשקי רשת כמו text-generation-webui, או ישירות מקוד פייתון בעזרת ספריות ctransformers ו־llama-cpp-python. אם המטרה היא מענה רב שיחתי ארוך, תמיכה באלפי משתמשים במקביל או משימות קוד מורכבות, עדיף לפנות ל־API מסחרי חיצוני ולא לנסות להחזיק את המודל הזה לבד.

ollama run hf.co/TheBloke/Orca-2-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל המקורי מופץ תחת רישיון המחקר של מיקרוסופט ובכפוף לרישיון הבסיס של LLaMA-2, והמאגר הנוכחי מסומן כ־other. בפועל, המשמעות היא שהשימוש מוגבל למחקר, ניסויים והערכת ביצועים בלבד. אסור להטמיע אותו במוצר מסחרי, באפליקציות צד לקוח או בכל תשתית עסקית שמניבה הכנסות.

הרישיון המלא בעמוד המודל ↗