GPT
R

rocket-3B-GGUF

קוד פתוח

TheBlokecc-by-sa-4.02023-11-22

  • transformers
  • gguf
  • stablelm
  • en

גרסה מכווצת של מודל שיחה קומפקטי בנפח שלושה מיליארד פרמטרים. היא מיועדת למי שחייב להריץ מודל מקומית על חומרה חלשה ובכל זאת רוצה ביצועים שמתקרבים למודלים כבדים בהרבה.

  • 20.0 GBמשקל הקבצים
  • 3,524הורדות בחודש
  • 41לייקים

מה זה

מדובר בהמרה של Rocket 3B מבית pansophic לפורמט GGUF, שנוצר על בסיס StableLM ועבר כוונון ישיר להעדפות אנושיות. המטרה כאן היא לסחוט יכולות שיחה ומענה ברמה גבוהה מתוך נפח קטן מאוד של שלושה מיליארד פרמטרים בלבד.

במדדי שיחה הוא עוקף מודלים גדולים ממנו בהרבה, עם ציון 6.56 במבחן MT-Bench ושיעור ניצחון של כמעט 80 אחוזים ב־AlpacaEval, תוך שמירה על תשובות מפורטות יחסית באורך ממוצע של 1,242 טוקנים. המשמעות היא שהוא מבין היטב הוראות ומחזיר טקסט קוהרנטי במענה הראשון, אם כי במענה השני באותה שיחה נרשמת ירידה מסוימת ברמה.

מתאים ל

  • בוט שיחה מקומי וזול

    דורש פחות מ־5 גיגה זיכרון עבודה ומספק איכות שיחה טובה מאוד ביחס למשקל שלו.

  • ניסוח טיוטות באנגלית

    מייצר תשובות ארוכות ומפורטות ומבין היטב הוראות בפורמט ChatML.

  • פיתוח שרץ בלי חיבור לרשת

    מאפשר לבנות יישומי בדיקה במחשב אישי ללא צורך בכרטיס מסך חזק.

איפה זה נופל

המודל אינו כולל סינון תשובות מובנה או מנגנוני בטיחות מחמירים, ובמבחן Toxigen הוא קיבל ציון של 43.40. זה אומר שהוא עלול לפלוט תוכן בעייתי בהינתן פרומפטים מסוימים, ולכן חובה להציב שכבת סינון לפני שחושפים אותו למשתמשי קצה.

בנוסף, מדדי הידע וההיגיון שלו בינוניים למדי. הוא קיבל 45.51 בלבד במבחן MMLU וציון חלש של 37.91 בפתרון בעיות מתמטיות ב־GSM8K, כך שלא הייתי סומך עליו במשימות שדורשות חישוב מדויק, לוגיקה מורכבת או שליפת עובדות מהימנה.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

עבור רוב השימושים מומלץ לקחת את rocket-3b.Q4_K_M.gguf. הוא שוקל 1.71 גיגה ומציג איזון אופטימלי בין שמירה על דיוק לבין צריכת משאבים נמוכה. גרסאות קטנות יותר כמו Q2 או Q3 גורמות לאיבוד איכות משמעותי.

האם המודל מתאים לעבודה בעברית?

הנתונים הרשמיים מציינים אנגלית בלבד, וכל מאגרי האימון שלו היו באנגלית. הוא לא אומן על עברית ולא מיועד לכך, ולכן הוא צפוי לפלוט ג'יבריש או תשובות שבורות לחלוטין בניסיון לכתוב בעברית.

איך מריצים

את הקבצים מריצים דרך llama.cpp או ספריות כמו ctransformers ו־llama-cpp-python, תוך שימוש בתבנית ChatML. גרסת Q4_K_M שוקלת 1.71 גיגה־בייט ודורשת בערך 4.21 גיגה־בייט זיכרון כדי לרוץ על המעבד לבדו, כך שאפשר להרים אותה כמעט על כל מחשב נייד או שרת זול.

אם יש כרטיס מסך בסיסי, אפשר לפרוק אליו את כל 32 השכבות ולקבל מהירות תגובה גבוהה מאוד. שווה להשתמש בזה רק אם אתם חייבים שהמידע יישאר מקומי או כשצריך אפס עלויות פר קריאה, כי מודלים מסחריים גדולים דרך API עדיין יספקו יכולות הבנה וניתוח עמוקות יותר.

ollama run hf.co/TheBloke/rocket-3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא CC-BY-SA-4.0. מותר להשתמש בו לצרכים מסחריים ולשנות אותו, אבל יש חובת ייחוס ליוצרים המקוריים, וכל שינוי או מודל נגזר שתפיצו חייב לצאת בדיוק תחת אותו רישיון שיתופי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗