GPT
S

Starling-LM-7B-alpha-GGUF

קוד פתוח

TheBlokecc-by-nc-4.02023-11-27

  • transformers
  • gguf
  • mistral
  • reward model
  • RLHF

גרסה מכווצת למודל שיחות של שבעה מיליארד פרמטרים מבית ברקלי, שעבר אימון מבוסס משוב ומתאים במיוחד להרצה מהירה על מעבד רגיל או כרטיס מסך בודד.

  • 51.2 GBמשקל הקבצים
  • 3,263הורדות בחודש
  • 94לייקים

מה זה

המודל הזה הוא גרסת GGUF של Starling-LM-7B-alpha, שפותח באוניברסיטת ברקלי על בסיס Openchat 3.5 ומיסטרל. המפתחים השתמשו בשיטת אימון עם משוב מבוסס בינה מלאכותית ומודל תגמול שדורג באמצעות GPT-4, כדי להפיק ממנו תשובות שנשמעות טבעיות ומדויקות יותר בהשוואה למודלים אחרים באותו סדר גודל.

במבחני MT Bench הוא השיג ציון 8.09, שמציב אותו מעל מודלים גדולים בהרבה כמו Llama-2-70b-chat ואפילו GPT-3.5-Turbo במבחן הספציפי הזה. מדובר בהישג חריג למשקל קל כזה, אבל צריך לזכור שציוני בנצ׳מרק לא תמיד משקפים עבודה יציבה בעולם האמיתי מחוץ לשיחה חופשית.

מתאים ל

  • עוזר שיחה מקומי באנגלית

    מציג ציוני שיחה גבוהים במיוחד לגודלו ומאפשר מענה קולח בלפטופ בלי שליחת מידע לרשת.

  • בדיקות אוטומציה ופיתוח

    קל להרצה עם llama-cpp-python ומאפשר לבדוק תהליכי עבודה מקומיים בלי לשלם על טוקנים.

  • מערכות דירוג ואימון

    נבנה עם מודל תגמול ייעודי ויכול לשמש כבסיס לחקר התאמת מודלים להעדפות משתמש.

איפה זה נופל

המודל אומן על מידע באנגלית בלבד. הוא לא מיועד לעברית, ולמרות שמודלי בסיס מסוגלים לעיתים לפלוט כמה מילים בעברית, כאן אין שום הבטחה לתחביר תקין או הבנה מקומית. בנוסף, הוא נשען על מבנה הנחיה ייעודי וקפדני של OpenChat, ואם תשכחו להשתמש בתבנית הזו הפלטים ישתבשו לגמרי.

שאלות
נפוצות

האם הוא יעבוד טוב בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד, ואין לו תמיכה רשמית בעברית. ניסוח שאלות בעברית יוביל לפלטים קטועים, שגיאות דקדוקיות והזיות.

איזה קובץ כדאי להוריד מתוך כל הרשימה?

הקובץ המאוזן ביותר לרוב השימושים הוא starling-lm-7b-alpha.Q4_K_M.gguf. הוא שומר על איכות טובה של המודל המקורי ודורש סביב 6.87 גיגה זיכרון כולל, כך שהוא ירוץ חלק על כמעט כל מחשב מודרני.

אפשר להטמיע אותו במוצר לחברה?

לא, הרישיון אוסר שימוש מסחרי מכל סוג שהוא. אם אתם בונים שירות שנועד להניב הכנסה או מוצר ארגוני, תצטרכו לבחור מודל עם רישיון מסחרי פתוח כמו Apache 2.0.

איך מריצים

כדי להריץ אותו לא צריך שרת מפלצתי. גרסת האיזון המומלצת, Q4_K_M, שוקלת 4.37 גיגה ומסתפקת בכמעט שבעה גיגה של זיכרון עבודה בהרצה על מעבד בלבד, או נכנסת בנוחות לכרטיס מסך צרכני עם שמונה גיגה זיכרון. אם המשאבים מוגבלים אפשר לרדת לכימותים כמו Q3_K_M, אבל איכות הפלט תיפגע בצורה מורגשת.

ההרצה מתבצעת ישירות דרך ספריות מבוססות llama.cpp, כלי שורת פקודה או ממשקים גרפיים כמו LM Studio ו־text-generation-webui. אם אתם צריכים רק שאילתות מזדמנות ואין לכם עניין לנהל תשתית מקומית, עדיף להישאר עם שירות ענן זמין, אבל לשימוש מקומי ומאובטח המודל הזה מתאים מאוד.

ollama run hf.co/TheBloke/Starling-LM-7B-alpha-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא cc-by-nc-4.0, כלומר שימוש מחקרי ולא מסחרי בלבד. המפתחים כפופים גם לתנאי השימוש של דאטה שנוצר על ידי OpenAI. אי אפשר לשלב את המשקולות האלו בשום מוצר שגובה כסף, פנימי או חיצוני, והוא נועד אך ורק לבדיקות, פיתוח אישי ומחקר.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗