GPT
A

aya-expanse-8b-GGUF

קוד פתוח

bartowskicc-by-nc-4.02024-10-24

  • gguf
  • text-generation
  • en
  • fr
  • de

גרסת קוונטיזציה של מודל שפות מבית Cohere, שמתאימה להרצה מקומית על מחשב אישי. היא פונה למי שמחפש ביצועים מגוונים בשפות אירופיות ואסייתיות בלי להחזיק שרת יקר.

  • 121 GBמשקל הקבצים
  • 8,674הורדות בחודש
  • 47לייקים

מה זה

המאגר הזה מכיל המרות שונות בפורמט GGUF למודל הבסיס של Cohere, שנוצר במקור עבור משימות יצירת טקסט רב לשוניות. המודל תומך בשמונה שפות מרכזיות, ביניהן אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית, יפנית וקוריאנית. עברית אינה מופיעה ברשימת השפות הנתמכות, ולכן מי שבונה עליו לעיבוד שפה מקומית צפוי להיתקל בקשיים.

המשקל המקורי של המודל עומד על 8 מיליארד פרמטרים, גודל שמאפשר לו לתפקד היטב במשימות שיחה וניסוח שוטף תוך שמירה על דרישות זיכרון שפויות. bartowski המיר את המשקלים באמצעות גרסה b3930 של llama.cpp תוך שימוש במטריצת חשיבות, טכניקה שנועדה לצמצם את אובדן הדיוק שנובע מדחיסת המשקלים. בחלק מהקבצים נעשה שימוש בכיול גבוה יותר לשכבות ההטמעה והפלט כדי לנסות לשמר איכות טקסט גבוהה יותר.

מתאים ל

  • עוזר מקומי רב לשוני

    ניסוח ותרגום טקסטים בשפות כמו גרמנית, צרפתית או יפנית ישירות על המחשב ללא תלות ברשת.

  • בדיקות פיתוח מקומיות

    אינטגרציה וניסוי של מבנה שיחה מבוסס טוקנים בסביבת פיתוח פנימית וללא עלויות ענן.

  • הפעלת מודל על מעבדי ARM

    שימוש בקבצים מותאמים אישית לשבבי ARM ייעודיים לצורך השגת מהירות עיבוד גבוהה בחומרה חלשה.

איפה זה נופל

החיסרון המרכזי עבור משתמשים ישראלים הוא היעדר תמיכה רשמית בעברית, כך שלא כדאי להסתמך עליו בעיבוד טקסט מקומי. בנוסף, פורמט הפרומפט קשיח מאוד ודורש מבנה טוקנים ספציפי כדי שהמודל יענה כראוי ולא ייכנס ללולאות טקסט מוזרות. בגרסאות המכווצות ביותר, כמו אלו ממשפחת Q2, רמת ההיגיון והיכולת לשמור על הקשר מורכב נפגעות בצורה ניכרת.

שאלות
נפוצות

האם המודל מתאים לשימוש מסחרי באפליקציה שלי?

לא. הרישיון הוא cc-by-nc-4.0 שמגביל את השימוש למטרות שאינן מסחריות בלבד. אם המוצר שלכם מייצר הכנסה או שייך לחברה מסחרית, אינכם רשאים להשתמש בקבצים האלה.

איזה קובץ כדאי להוריד למחשב עם כרטיס מסך ממוצע?

הקובץ המומלץ לרוב המשתמשים הוא Q4_K_M בנפח של 5.06 ג״ב, שמשלב איכות טובה עם צריכת משאבים נמוכה. אם יש לכם כרטיס מסך עם 8 ג״ב זיכרון וידאו, המודל ייכנס כולו לזיכרון וירוץ במהירות מקסימלית.

איך מריצים

להרצה מהירה ונוחה אפשר להשתמש בתוכנות כמו LM Studio או ישירות דרך llama.cpp. כדי להוריד קובץ ספציפי משתמשים בכלי השורה huggingface-cli ומציינים את השם המדויק, במקום להוריד את כל המאגר. הגרסה המומלצת לרוב השימושים היא Q4_K_M ששוקלת 5.06 ג״ב ונכנסת בקלות לכרטיס מסך עם 8 ג״ב זיכרון וידאו, מה שמבטיח מהירות תגובה גבוהה.

אם אין לכם כרטיס מסך ייעודי, גרסאות הקידוד הנמוכות יותר, כמו IQ3_M בנפח של כארבעה ג״ב, ירוצו גם על מעבד רגיל. למשתמשי מעבדי ARM יש גרסאות מותאמות כמו Q4_0_4_4 שמציעות מהירות גבוהה יותר, אך הן אינן מיועדות למחשבי מק או ווינדוס רגילים. אם אתם זקוקים להרצה רחבה בענן עם זמינות מלאה, עדיף לפנות ישירות לשרתי צד שלישי מאשר לתחזק חומרה מקומית.

ollama run hf.co/bartowski/aya-expanse-8b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון cc-by-nc-4.0. המשמעות היא שאתם רשאים להוריד, להריץ ולשנות אותו לצרכים פרטיים, לימודיים או מחקריים בלבד, אך אסור לחלוטין לשלב אותו במוצר מסחרי, לגבות עליו כסף או להציע אותו כשירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗