מערכת סיכום הרצאות מבוססת בינה מלאכותית

עיבוד הרצאות עם איכות שמע משתנה

AI Development Areas

שאלות נפוצות

העבודות האחרונות

  • image_website-b2b-advance_0.webp
    B2B ADVANCE company website development
    1443
  • image_web-applications_feedme_466_0.webp
    Development of a web application for FEEDME
    1302
  • image_websites_belfingroup_462_0.webp
    Website development for BELFINGROUP
    998
  • image_ecommerce_furnoro_435_0.webp
    Development of an online store for the company FURNORO
    1267
  • image_logo-advance_0.webp
    B2B Advance company logo design
    714
  • image_crm_enviok_479_0.webp
    Development of a web application for Enviok
    1006

עיבוד הרצאות עם איכות שמע משתנה

האתגר הטכני העיקרי בסיכום הרצאות אוטומטי הוא רעש ומבטאים ברצועת השמע. מערכת רישום ההערות שלנו מבוססת בינה מלאכותית מעבדת וידאו, אודיו ושקופיות PDF באמצעות Whisper large-v3 (OpenAI) עם הפרמטר word_timestamps=True. המודל עמיד בפני רעשי רקע וניבים; במידת הצורך, אנו מבצעים כוונון עדין על קורפוס ההרצאות של האוניברסיטה באמצעות fine-tuning. עבור טיוטה מהירה, ניתן להשתמש במודל base, אך עבור טקסטים אקדמיים, large-v3 מספק שיפור דיוק של 15–20%.

השוואת מודלי Whisper
מודל דיוק (WER) מהירות (לכל 10 דקות הרצאה) המלצה
base ~12% 10–15 שניות (CPU/GPU) טיוטה מהירה
large-v3 ~5% 30–60 שניות (GPU) סיכום מדויק

Whisper large-v3 מדויק פי 2.4 מהמודל base (WER 5% לעומת 12%).

import whisper model = whisper.load_model("large-v3") # "base" для скорости, "large-v3" для качества result = model.transcribe( "lecture.mp4", language="ru", verbose=False, word_timestamps=True, ) transcript = result["text"] segments = result["segments"] 

עבור הרצאות אקדמיות עם טרמינולוגיה מתמחה, large-v3 מדויק משמעותית יותר. זמן עיבוד על GPU: ~10 דקות הרצאה ב-30–60 שניות.

למה אנו בוחרים ב-Whisper large-v3 להרצאות אקדמיות

דיוק התמלול משפיע ישירות על איכות הסיכום. בבדיקות על הקלטות מ-MIPT ו-HSE, large-v3 השיג WER מתחת ל-5%, בעוד שהמודל base שגה בכל מילה עשירית. מחקרים מראים ש-Whisper large-v3 משיג שיעור שגיאות מילים (WER) מתחת ל-5% על הרצאות אקדמיות (Radford et al., 2023). אנו גם מיישמים עיבוד לאחר: הסרת מילות עצירה, נורמליזציה של מונחים ושחזור פיסוק. זה מפחית את העומס על ה-LLM ומאיץ את יצירת המסמך הסופי. כדי לשפר את הדיוק בנושאים מתמחים (רפואה, משפטים), אנו מבצעים כוונון עדין על קורפוס של 100–500 הרצאות מסומנות.

איך אנו בונים את המערכת

אנו מתכננים את הצינור (pipeline) סביב הנתונים והתשתית שלך. השלבים הסטנדרטיים:

  1. ניתוח — בחינת פורמטי המקור, בחירת מחסנית אופטימלית (Whisper, PyTorch, LangChain, Qdrant לחיפוש וקטורי).
  2. עיצוב — פיתוח סכמת עיבוד: אודיו → תמלול → הנחיית LLM → סיכום מובנה → ייצוא.
  3. יישום — כתיבת קוד, הגדרת מודלים, אינטגרציה עם LMS (Moodle, Canvas) דרך REST API.
  4. בדיקות — ריצה על 50+ הרצאות אמיתיות, מדידת איכות סיכום (ROUGE, BLEU).
  5. פריסה — פריסה על שרת GPU משלך או בענן (AWS SageMaker, Vertex AI).
  6. תיעוד והדרכה — מתן הוראות למנהלי מערכת וסטודנטים.

איך LLM מבנה הערות ונמנע מהזיות

לאחר התמלול, הטקסט עובר ל-LLM (אנו משתמשים ב-GPT-4 או Claude 3.5) עם הנחיה מפורטת. ההנחיה דורשת:

  • חילוץ נקודות מפתח (מקסימום 3 לכל קטע של 10 דקות).
  • קיבוץ שלהן למדורים עם דוגמאות ונוסחאות.
  • יצירת 3–5 שאלות לבדיקה עצמית.
  • אי הוספת מידע שאינו קיים בטקסט המקורי.

לאימות נוסף, אנו משלבים שכבת RAG: לפני יצירת מדור, ה-LLM מאחזר את קטעי התמלול הדומים ביותר מבחינה סמנטית באמצעות חיפוש וקטורי על embeddings (מודל import whisper model = whisper.load_model("large-v3") # "base" для скорости, "large-v3" для качества result = model.transcribe( "lecture.mp4", language="ru", verbose=False, word_timestamps=True, ) transcript = result["text"] segments = result["segments"] ). זה מפחית את הסתברות ההזיות לפער סטטיסטי (<0.5% בבדיקות).

לוחות זמנים ואיך להתחיל

פרויקט turnkey טיפוסי אורך 2 עד 6 שבועות, תלוי במספר המקורות (וידאו בלבד או שקופיות + וידאו) ובעומק ההתאמה האישית (fine-tuning, RAG, הנחיות מותאמות). העלויות מתחילות ב-$5,000 ויכולות לחסוך עד $20,000 לסמסטר בעלויות תמלול ידני. המערכת שלנו מעבדת הרצאות פי 10 מהר יותר מרישום הערות ידני.

צור קשר כדי לדון במשימה שלך. קבל הערכת פרויקט חינמית וייעוץ יישום — נראה כיצד המערכת משתלבת בתהליך החינוכי שלך.

מה כלול בפרויקט

  • הקמת צינור תמלול (Whisper large-v3, כוונון עדין במידת הצורך)
  • הנדסת הנחיות LLM ואינטגרציית RAG למבנה הערות מדויק
  • אינטגרציית REST API של LMS (Moodle, Blackboard, Canvas)
  • תיעוד משתמש והדרכת מנהלי מערכת
  • חודש אחד של תמיכה לאחר פריסה
תכונות נוספות
  • חותמות זמן: כל מדור בסיכום מקושר לרגע בוידאו.
  • כרטיסי פלאש: יצירה אוטומטית של כרטיסי Anki ממונחי מפתח.
  • משאבים קשורים: מקורות מצוטטים כקישורים.
  • שאלות מבחן: יצירת שאלות להערכה עצמית.
  • ייצוא: Markdown, PDF, דף Notion, אינטגרציה עם LMS דרך API.

למהנדסים שלנו יש ניסיון של 10+ שנים ב-NLP ו-MLOps. אנו מבטיחים שכל סיכום עובר בדיקות הזיות — ה-LLM אינו מוסיף מידע שאינו קיים בהרצאה המקורית. מומחים מוסמכים ב-PyTorch ו-Hugging Face.

השוואת שיטות תמלול

שיטה דיוק (WER) זמן עיבוד עלות GPU
Whisper base ~12% ~15 שניות/10 דקות נמוכה
Whisper large-v3 ~5% ~45 שניות/10 דקות בינונית
Google Speech-to-Text ~8% ~30 שניות/10 דקות גבוהה

רשימת בדיקה לפרויקט פיילוט

  • איסוף 10–20 הרצאות מייצגות בפורמטים שונים (MP4, MP3, PDF).
  • זיהוי ה-LMS היעד ושיטת האינטגרציה (API, ייבוא קבצים).
  • בחירת השפה ומודל Whisper (base או large-v3).
  • הכנת הנחיות LLM לסגנון הסיכום הרצוי.
  • בדיקה על 3–5 הרצאות והתאמת הצינור.

תיעוד רשמי של Whisper