GPT
S

SOLAR-10.7B-Instruct-v1.0-GGUF

קוד פתוח

TheBlokeapache-2.02023-12-13

  • transformers
  • gguf
  • solar
  • conversational

גרסת GGUF מכווצת למודל של 10.7 מיליארד פרמטרים שמתאים להרצה מקומית. הוא נועד למי שרוצה ביצועים חזקים של הוראה ישירה בלי להחזיק שרת כבד.

  • 75.7 GBמשקל הקבצים
  • 2,649הורדות בחודש
  • 84לייקים

מה זה

המודל מבוסס על SOLAR-10.7B של חברת Upstage, שעבר המרה וכימות לפורמט GGUF על ידי TheBloke. המפתחים שלו בנו אותו על בסיס ארכיטקטורת Llama2 תוך שימוש בשיטה שהם מכנים Depth Up-Scaling, שילבו משקלים של Mistral 7B בתוך השכבות המורחבות, והמשיכו את האימון המקדים. התוצאה היא מודל ביניים של כמעט 11 מיליארד פרמטרים, גודל שלא רואים הרבה בתחום שנשלט על ידי 7B או 13B.

לפי היוצרים, המבנה הזה מאפשר לו לעקוף מודלים של עד 30 מיליארד פרמטרים ואפילו את Mixtral 8X7B במבחנים מסוימים, אם כי הקישורים לטבלאות הניסויים המלאות טרם עודכנו בכרטיס המקורי. הגרסה הזו כוללת כוונון להוראות, ומגיעה בקבצים מכווצים בשיטות שנעות בין 2 ביט ל־8 ביט, שמאפשרות לטעון אותו על מחשבים אישיים או שרתים קטנים יחסית.

מתאים ל

  • מענה לפקודות במעבר בודד

    הוא אומן בדיוק בשביל לקבל הוראה ישירה אחת, לעבד אותה ולהחזיר תשובה מדויקת בלי צורך בהיסטוריית שיחה.

  • מיצוי מידע וסיכום קצר

    משקל ה־10.7B נותן הבנה טובה של טקסטים קצרים ומשימות סיווג, מעבר ליכולת של מודלי 7B סטנדרטיים.

  • בסיס לכיול נוסף

    היוצרים מציינים שהמבנה שלו יציב ומתאים במיוחד לפיין-טיונינג פנימי לפי צרכים ספציפיים של הארגון.

איפה זה נופל

המגבלה הכי גדולה של המודל כתובה בפירוש בכרטיס שלו: הוא עבר אימון ייעודי למענה יחיד, single-turn conversation. היוצרים מבהירים בעצמם שהוא פחות מתאים לשיחות מתמשכות או צ'אט מרובה שלבים. בנוסף, חלון ההקשר מוגדר ל־4096 טוקנים, כך שהוא לא בנוי לקריאת מסמכים ארוכים במיוחד.

שאלות
נפוצות

איזה קובץ כדאי לי להוריד מתוך הרשימה?

ההמלצה המאוזנת לרוב המשתמשים היא גרסת Q4_K_M ששוקלת כ־6.46 GB, או גרסת Q5_K_M ששוקלת 7.60 GB אם יש לכם מספיק זיכרון ואתם רוצים מינימום איבוד דיוק. קבצי ה־Q2 וה־Q3 גורמים לירידה מורגשת באיכות הפלט ולא מומלצים אלא אם החומרה שלכם מוגבלת מאוד.

האם המודל מתאים לפיתוח בוט שיחה שזוכר היסטוריה?

לא. המפתחים מציינים בפירוש שהכוונון נעשה לשיחה של מעבר בודד בלבד, ולכן הוא לא מיועד למעקב אחרי דיאלוגים מורכבים וצפוי לאבד את ההקשר בשיחה ארוכה.

איך מריצים

בשביל להריץ אותו צריך כלי שתומך בפורמט GGUF, כמו llama.cpp, שרת llama-cpp-python, או תוכנות עם ממשק גרפי כמו LM Studio ו־text-generation-webui. אין שום סיבה להוריד את כל המאגר ששוקל עשרות ג'יגהבייט. בוחרים קובץ אחד בלבד לפי החומרה שיש לכם. קובץ כמו Q4_K_M שוקל 6.46 GB ודורש בערך 8.96 GB של זיכרון אם מריצים אותו על המעבד בלבד, או כרטיס מסך עם לפחות 8 GB של זיכרון ייעודי כדי לפרוק אליו את רוב השכבות.

אם יש לכם כרטיס מסך ביתי טוב או מחשב מק עם מעבד סיליקון וזיכרון אחוד של 16 GB, קבצי ה־Q4 או ה־Q5 ירוצו במהירות מצוינת. אם אין לכם חומרה כזו ואתם נאלצים לרדת לקבצי Q2_K שפוגעים משמעותית באיכות הפלט, עדיף לפנות למודל מרוחק דרך API.

ollama run hf.co/TheBloke/SOLAR-10.7B-Instruct-v1.0-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי הקוד, הפצה והטמעה בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗