GPT
G

granitelib-rag-r1.0

קוד פתוח

ibm-graniteapache-2.02025-12-08

  • granite-library
  • safetensors
  • gguf
  • en

אוסף מתאמי LoRA שמיועד לפרק צינורות RAG למשימות מוגדרות מראש. במקום לתת למודל אחד לעשות הכול, מריצים שלבים ייעודיים לדיוק השאילתה, בדיקת עובדות וציטוטים.

  • 13.5 GBמשקל הקבצים
  • 10,687הורדות בחודש
  • 47לייקים

מה זה

המאגר הזה כולל שישה מתאמי LoRA וגרסאות aLoRA עבור מודלי הבסיס מסדרת Granite, החל מגרסת המיקרו ועד 30B. כל מתאם נבנה למשימה בודדת בתוך צינור עבודה מבוסס סוכנים: שכתוב שאילתות של משתמש כדי שיהיו עצמאיות, זיהוי מקרים שדורשים הבהרה מול המשתמש, סיווג רלוונטיות של פסקאות מידע, בדיקה אם המידע בכלל מספיק למתן תשובה, זיהוי הזיות ברמת המשפט הבודד ויצירת ציטוטים מתוך הטקסט התומך.

הגישה כאן מפצלת את הטיפול ברכיבי RAG לרכיבים קטנים שאפשר להפעיל לפני השליפה, לפניה היצירה או מיד אחריה. התוצאה היא יכולת להחליף מודלים כלליים כבדים במודלים קטנים יותר שמכוונים בדיוק למשימת הבקרה שלהם, עם חתימות דיגיטליות שמוודאות את מקור הקבצים.

מתאים ל

  • שכתוב שאלות לפני שליפה

    מנקה את תלות השאלה בהיסטוריית השיחה ומייצר שאילתה עצמאית שמשפרת את דיוק מנוע החיפוש.

  • בקרת איכות ומניעת הזיות

    בוחן כל משפט בתשובה מול הפסקאות שנשלפו וקובע טווח סיכון להזיה לפני שהטקסט מגיע למשתמש.

  • הצמדת ציטוטים לתשובות

    ממפה משפטים ספציפיים מתוך חומר המקור אל התשובה שנוצרה, גם אם היא הופקה על ידי מודל אחר.

איפה זה נופל

המתאמים אומנו על אנגלית בלבד, כך שבלי בדיקה מעמיקה הם לא יעבדו בצורה אמינה על שאילתות או מסמכים בעברית. בנוסף, חלוקת העבודה לשישה מתאמים שונים מוסיפה השהייה ניכרת לכל קריאה אם מריצים אותם בזה אחר זה, ומתאם הרלוונטיות זמין רק עבור מודל המיקרו. הכרטיס אינו כולל ציוני ביצועים או מדדי דיוק מספריים, כך שאי אפשר לדעת מראש מה שיעור הפספוסים בזיהוי הזיות או בשכתוב.

שאלות
נפוצות

האם המודל תומך בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. אם תריצו אותו על מסמכים או שאלות בעברית, סביר להניח ששכתוב השאילתות ובדיקת ההזיות ייכשלו או יחזירו תוצאות לא יציבות.

אפשר להריץ את כל המתאמים יחד על מחשב מקומי?

זה תלוי במודל הבסיס. המתאמים של גרסאות המיקרו ו־3B ירוצו בקלות על כרטיס מסך ביתי בודד, אבל שרשור של כל השלבים ידרוש טעינה חוזרת של מתאמים שתוסיף זמן המתנה לכל תשובה.

חייבים להשתמש בספריית Mellea כדי להפעיל אותם?

התיעוד ממליץ על Mellea, אך היות שמדובר במתאמי LoRA תקניים, אפשר לטעון אותם גם בעזרת ספריות תואמות אחרות שתומכות במודלי Granite ובמשקלי safetensors חתומים.

איך מריצים

לא מדובר במודל יחיד שעולה לזיכרון ופולט תשובה, אלא באוסף משקלים שצריך לטעון מעל מודלי הבסיס של Granite באמצעות ספריית מודלים או שלד המערכת Mellea. משקל הקבצים הכולל הוא 13.5 גיגה-בייט שמפוזרים על פני 246 קבצים, כך שגודל החומרה תלוי לחלוטין במודל הבסיס שבוחרים להריץ, ממיקרו ועד 30B.

אם אתם צריכים רק שלב בודד, כמו שכתוב שאילתה, אפשר להסתפק בחומרה צנועה עבור המודלים הקטנים. שרשור של כמה מתאמים יחד באותו תהליך דורש ניהול זיכרון וטעינת משקלים דינמית, ובמצב כזה קריאה לשרת ייעודי או שירות מרוחק תחסוך את כאב הראש התשתיתי.

ollama run hf.co/ibm-granite/granitelib-rag-r1.0:BF16

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

246 קבצים במאגר, 13.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה שלהם בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗