GPT
O

m-ric/open-notebooklm

רץ בדפדפן

m-ricapache-2.02025-04-24

  • gradio

מעלים קובץ או טקסט ומקבלים קובץ שמע של פודקאסט זוגי שמנתח את החומר. זה מיועד למי שרוצה חלופה פתוחה ליצירת שיחות אודיו אוטומטיות ממסמכים.

  • הורדות בחודש
  • 143לייקים

מה זה

אתם מזינים טקסט ישיר או מעלים קובץ כמו מסמך PDF, ויכולים להוסיף הנחיה ממוקדת לגבי זווית הדיון או שאלות ספציפיות שמעניינות אתכם. בדוגמאות המובנות בממשק יש למשל קובץ PDF של מאמר על פלנטיר לצד הנחיה לשמור על גישה ביקורתית בניתוח. בסוף התהליך מקבלים נגן אודיו עם שיחה מוקלטת בין שני מנחים שמדברים על החומרים שהזנתם.

מאחורי הקלעים רץ שילוב של שני מודלים שונים לחלוטין. הפיכת התוכן לתסריט שיחה מתבצעת בעזרת Llama-3.3-70B-Instruct של מטא דרך קריאות שרת, והקראת הדו-שיח לקולות נפרדים נעשית באמצעות מודל הקול Kokoro-82M. התוכנה משתמשת בספריית PyMuPDF כדי לחלץ את הטקסט מהקבצים שהעליתם לפני שהיא מעבירה אותם לעיבוד.

מתאים ל

  • המרת מאמרים לפודקאסט

    מעלים קובץ PDF באנגלית ומקבלים שיחה מוקלטת שמסכמת ומנתחת את הטיעונים המרכזיים.

  • סקירת נושא מותאמת

    מדביקים טקסט ומבקשים במפורש להתמקד בביקורת או בשאלות פתוחות לקראת האזנה.

  • בדיקת מודל הקול Kokoro

    בוחנים איך המודל מייצר שתי דמויות שונות שמנהלות דיאלוג רציף מתוך תסריט כתוב.

איפה זה נופל

הבעיה המרכזית כרגע היא שהאפליקציה נמצאת במצב תקלת ריצה ולא באמת פועלת בעמוד. מעבר לכך, היא מוגדרת על חומרת מעבד רגילה בלי מאיץ גרפי ייעודי, מה שהופך יצירת קול במודל Kokoro לתהליך כבד שעלול להיחנק. הדוגמה המוכנה בממשק נשמרת מראש במטמון ולכן היא מטעה לגבי מהירות העבודה האמיתית. המודלים האלה מותאמים לאנגלית, כך שניתוח מסמכים בעברית או דיבור בעברית לא יעבדו כאן כמו שצריך. תמיד כדאי לוודא שהמסמך לא מכיל מידע רגיש לפני ששולחים אותו.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, השימוש בעמוד פתוח ללא תשלום. אין צורך בהזנת כרטיס אשראי או רכישת מנוי כדי להריץ אותה.

האם אפשר להשתמש בה כרגע בדפדפן?

לא מומלץ לבנות על זה כרגע כי המצב שלה מוגדר כשגיאת ריצה. כדי שהיא תעבוד תצטרכו לחכות שהמפתח יתקן אותה או לשכפל את הקוד ולהריץ בעצמכם.

מה קורה עם קבצים שאני מעלה?

הקבצים נשלחים לעיבוד בענן לצורך חילוץ הטקסט ויצירת השיחה. אל תעלו מסמכים מסווגים, פרטיים או כאלה שמכילים מידע אישי ורגיש.

במה זה שונה משימוש ישיר במודל השפה?

הכלי מחבר את מודל השפה למודל קול חיצוני ולספריית קריאת מסמכים. במקום לקבל רק טקסט כתוב, התוצאה הסופית היא קובץ שמע שמדמה שני אנשים שמדברים.

איך משתמשים

נכנסים לממשק, בוחרים אם להדביק טקסט או להעלות קובץ, מקלידים הנחיה אופציונלית ולוחצים על הפעלה כדי להפיק את האודיו. לא צריך להירשם או לשלם כדי לנסות. האפליקציה מוגדרת על מעבד בסיסי, מה שאומר שיצירת האודיו מקרטעת ואיטית בהרבה בהשוואה להרצה על מעבד גרפי. כרגע מדווח עליה מצב שגיאת ריצה, כך שייתכן שהיא תיכשל מיד או לא תגיב כלל בעת הפנייה.

הרישיון

הפרויקט מפורסם ברישיון קוד פתוח מסוג Apache 2.0. הרישיון הזה מתיר שימוש חופשי, שינוי והפצה של הקוד, כולל שימוש מסחרי. לגבי הקבצים שאתם מעלים ותוצרי האודיו, הם מעובדים בסביבה הציבורית ולא מקבלים הגנת פרטיות מיוחדת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗