- מחקרים חדשים בבינה מלאכותית מפענחים תקשורת של עורבים, פילים, לווייתנים ודולפינים בקנה מידה חסר תקדים
- למרות התקדמות טכנולוגית, פילוסופים ומדענים מזהירים שדמיון אקוסטי אינו מוכיח הבנת משמעות או כוונה אמיתית
- מודלים גנרטיביים כמו ZF-AIM מתחילים לתקשר בזמן אמת עם בעלי חיים, מעוררים שאלות אתיות על שימוש ופגיעה
מחקר שפורסם ב־Animal Cognition ב־2025 פתח חלון יוצא דופן אל חייהם הקוליים של עורבים שחורים בצפון ספרד. החוקרים הצמידו ל־52 עורבים תגיות זעירות שכללו מיקרופון וחיישני תנועה, ואספו בממוצע יותר מ־83 שעות מכל מכשיר. מודל Voxaboxen איתר למעלה מ־127 אלף קולות והבחין בין העורב המתויג, בוגרים אחרים, גוזלי עורב וגוזלי קוקייה. המאגר חשף תקשורת שקטה וקצרת־טווח שהמיקרופונים המקובלים כמעט לא קלטו. הוא עדיין לא גילה מה העורבים אמרו.
ניסוי אחר דחף את הגבול מפענוח להשתתפות. חוקרי Earth Species Project ואוניברסיטת מקגיל אימנו את ZF‑AIM על כ־1.5 מיליון קריאות של נקבות פרוש זברה. המודל הגיב לציפור חיה בזמן אמת והפיק חילופי קולות שדמו לדינמיקה טבעית. העבודה, שהוצגה ב־ICLR 2026 ופורסמה כקדם־מאמר, אינה מוכיחה שיחה סמנטית. מחקר מאוניברסיטת תל אביב, שפורסם ב־Current Biology, מסביר מדוע: רשתות עמוקות קיבצו קולות פעוטות בעלי כוונות שונות והפרידו בין ביצועים שונים של אותה כוונה. דמיון אקוסטי ודמיון תקשורתי אינם אותו דבר.
אריסטו הבחין בין קול לדיבור רציונלי. בעלי חיים, כתב ב״פוליטיקה״, מבטאים כאב ועונג; האדם מבטא גם מועיל, מזיק, צודק ועוול. השפה נעשתה תנאי לחיים מוסריים ומדיניים: לחיה phonē, ולאדם logos שממנו נוצרים חוק, שיפוט ועיר.
דקארט הקשיח במאה השבע־עשרה את ההפרדה. התאמה לסביבה לא הוכיחה בעיניו מחשבה. חיה עשויה להגיב בדיוק כמנגנון המגיב לגירוי, בלי למסור מחשבה חופשית. שאלתו נותרה תקפה: התנהגות תבונית אינה חושפת בהכרח את מנגנונה.
דרווין שינה ב־1871 את כיוון הדיון. ב״מוצא האדם״ תיאר הבדל של דרגה, לא של סוג. חיקוי, זיכרון, למידה חברתית וקריאות אזהרה נעשו רכיבים ברצף אבולוציוני, והשפה נבחנה כמערכת שמרכיביה מפוזרים בין מינים.
במאה העשרים ניסו החוקרים להכניס בעלי חיים אל תוך מערכות הסימנים של האדם. השימפנזה Washoe אומנה להשתמש במחוות משפת הסימנים האמריקאית כדי לבקש מזון, לזהות חפצים ולתאר פעולות; Sarah, שימפנזה נוספת, למדה לבחור ולסדר סמלים חזותיים מפלסטיק על לוח; הגורילה Koko רכשה, לפי מאמניה, מאות מחוות ששימשו אותה לתקשורת עם בני אדם. הניסוי המחמיר יותר נערך עם השימפנזה Nim Chimpsky, ששמו היה קריצה לבלשן נועם חומסקי: החוקרים ביקשו לברר אם הוא מסוגל לא רק להשתמש בסימנים, אלא גם לצרף אותם למשפטים לפי כללים תחביריים.
התוצאות חשפו יכולת קוגניטיבית מרשימה, אך גם גבול ברור. הקופים למדו לקשור סימנים לחפצים, לפעולות, לבקשות ולתגמולים, ולעיתים שילבו כמה סימנים ברצף. עם זאת, הרצפים נטו להיות קצרים, חזרתיים ותלויים בהכוונת המאמן. הם לא סיפקו הוכחה משכנעת לתחביר פתוח ויצרני: מערכת כללים המאפשרת לבנות באופן עצמאי מספר בלתי מוגבל של משפטים חדשים ולהבחין בין משמעויות באמצעות סדרם ומבנם.
ב־1979 בחנו הרברט טרס ועמיתיו את תיעודי Nim. רצפים רבים באו לאחר רמזים, כללו חיקוי ושימשו להשגת תוצאה מיידית. יכולתו הקוגניטיבית לא נשללה; החיה פשוט נבחנה במוסד אנושי, מול מורים ובקטגוריות שנקבעו מראש.
האזהרה הופיעה אצל הסוס ״הנס החכם״. הוא נראה כפותר חשבון בנקישות, עד שאוסקר פפונגסט הראה כי קרא שינויים זעירים בגופם של השואלים. הסוס הפגין רגישות חברתית, ובני האדם ייחסו אותה למתמטיקה. יכולת אמיתית קיבלה הסבר שגוי.
הקושי החישובי מתחיל עוד לפני השאלה מה נאמר. הקלטה ביולוגית היא זרם רציף, ללא מילים, סימני פיסוק או גבולות מוסכמים. למידה עצמית ללא תיוג נדרשת לגלות אילו שינויים הם יחידות תקשורת ואילו נובעים מנשימה, מרחק, תנועה או רעש. כאשר המודל מחלק את הרצף, הוא כבר מציע תיאוריה על מבנה השפה.
לאחר הפילוח נבנה embedding: ייצוג מתמטי שבו קולות דומים ממוקמים זה לצד זה. הקרבה יכולה לשקף משמעות, אך גם זהות, מיקרופון, אתר או מצב גופני. זו גרסתו האלגוריתמית של הנס החכם. דיוק במדגם עשוי לנבוע מקיצור דרך סטטיסטי, ולכן נדרשות הכללה בין פרטים וסביבות ובדיקות המסתירות מן המודל רמזים חלופיים.
מושג ה־Umwelt של פון אוקסקיל ממסגר את הבעיה ביולוגית. כל אורגניזם פועל בתוך עולם תפיסתי המעוצב בידי חושיו וגופו. כלב קורא שכבות ריח שאדם כמעט אינו חש; עטלף בונה מרחב באמצעות הד; לווייתן זרע מתקיים בחושך, בעומק ובלחץ, בתוך מרחב אקוסטי עצום. תרגום המנתק אות מן העולם הזה עלול להיות מדויק סטטיסטית וחסר ערך ביולוגי.
ויטגנשטיין ניסח את הקושי במשפט מפורסם: אילו אריה יכול היה לדבר, לא היינו מבינים אותו. מילון לבדו אינו מפענח קול. פשרו נוצר בתוך גוף, חברה, זיכרון וצורת חיים. גם התאמה מושלמת בין רצף קליקים להתנהגות מסוימת אינה מבטיחה שגילינו מה הקליקים אומרים עבור הלווייתן. ייתכן שגילינו רק איזה משתנה אנושי המסוגל לנבא את הופעתם.
פילוסוף השפה פול גרייס העלה ב־1957 רף תובעני עוד יותר. תקשורת מלאה דורשת שהמשדר יתכוון לכך שהנמען יזהה את כוונתו, ושזיהוי הכוונה יהיה חלק מן הסיבה לתגובה. קריאת אזעקה עשויה לגרום לבריחה בלי שנדע אם החיה ביקשה לשנות את ידיעתו של האחר. הבינה המלאכותית מסוגלת למפות אות ותוצאה; היא מתקשה להוכיח את המצב המנטלי המחבר ביניהם.

הדבורים מספקות דוגמה מוקדמת לכוחו של ניסוי סיבתי. ריקוד הנענוע מעביר כיוון ומרחק למקור מזון ביחס לשמש. מעקב מכ"ם הראה שהמגויסות משתמשות בווקטור, ורובוט מחקה הצליח לגרום להן לעקוב אחריו ולשנות נתיב. לפנינו קוד התייחסותי יעיל, גם בלי דקדוק אנושי. הממצא מפרק את ההנחה שרק מוח הדומה לשלנו מסוגל לייצר תקשורת מדויקת על דבר המצוי במקום אחר.
אצל קופי ורווט התקבלו ב־1980 תגובות שונות לקריאות שהושמעו ללא טורף: טיפוס, מבט לשמים או חיפוש בקרקע. אצל קופי קמפבל, הסיומת oo מחלישה או מרחיבה איום; אצל הירגזי היפני, שינוי סדר רכיבי אזהרה וגיוס משנה תגובה. קריאות נובחניות אף נקשרו לסוג הטורף, גודלו וצבעו, אך עדיין חסרים שכפול עצמאי וניסויי השמעה מספקים. אלה מבנים פונקציונליים, לא משפטים אנושיים.
מעבדתו של יוסי יובל באוניברסיטת תל אביב בנתה בעטלפי פירות מצריים רצף ראיות נדיר. ניסוי מ־2015 הראה שגורים רוכשים דיאלקט מן הקבוצה; מחקר מ־2016 ניתח כמעט 15 אלף קולות ומצא מידע על המשדר, הנמען, ההקשר ותוצאת העימות; מאגר מ־2017 הנגיש כ־90 אלף קבצים מתויגים; וב־2023 נותחו 3,601 רצפים. הרצף השלם נשא הקשר רב יותר מהברות בודדות, אולם שינוי סדרן כמעט לא שינה את הסיווג. למידה וקומבינטוריות, מתברר, אינן מחייבות תחביר תלוי־סדר.
טענות על תוויות אישיות התחזקו ב־2024 בשני מינים. אצל מרמוסטים, עשרה פרטים פנו זה לזה בקריאות phee מובחנות והגיבו בעקביות לתווית שלהם. אצל פילי סוואנה, למידת מכונה זיהתה בקריאות מידע על זהות הנמען, ולאחריה הגיע ניסוי מכריע: פילים הגיבו במהירות ובעוצמה רבות יותר לקריאות שיועדו להם מאשר לקריאות של אותו משדר שהופנו לאחר. תיקון מ־2025 שינה מקדמים אחדים, לא את המסקנה. שתי העבודות תומכות בפנייה אינדיבידואלית; רק הפילים נבחנו בשדה באמצעות playback.
גם דולפינים משתמשים בשריקות חתימה נלמדות. ניסויים הראו שהם מזהים את צורת השריקה לאחר הסרת מאפייני הקול האישיים, מעתיקים שריקה של פרט אחר כדי לפנות אליו ומגיבים כאשר ״קוראים״ להם. הראיה לשם קולי חזקה; הראיה למילון רחב עדיין חסרה. DolphinGemma, שהציגה Google ב־2025, לומד לחזות ולהפיק רצפי קול, אך יכולת השלמת רצף אינה הוכחה להבנת תוכנו.
Project CETI ניתח ב־2024 8,719 רצפי קודה של לווייתני זרע והפריד ארבעה ממדים: קצב, מהירות, שינויי tempo הדרגתיים ועיטור בקליק נוסף. לפחות 143 צירופים הופיעו בתדירות מובהקת. מחקר מ־2026 זיהה תבניות ספקטרליות דמויות תנועות ודיפתונגים. אצל לווייתני גיבנת, ניתוח שמונה שנות שירה ב־2025 מצא התפלגות דמוית חוק ציפף, באמצעות שיטת פילוח שנבנתה לחקר למידת שפה אצל תינוקות. שתי התוצאות חושפות ארגון מרשים; אף אחת אינה מספקת פירוש למסרים.
שרשרת ההוכחה נקטעת בקלות. קומבינטוריות אינה תחביר; תחביר אינו סמנטיקה; סמנטיקה אינה כוונה. מחקר על בונובו שפורסם ב־Science ב־2025 טען לארבעה מבנים קומפוזיציוניים, אולם ניתוח מ־2026 מצא שהמובהקות נעלמת תחת מבחן פרמוטציה מחמיר ושחלק מהצירופים נשענו על תצפיות מעטות. המחלוקת ממחישה כיצד שפה אנושית עשויה להיכנס למסקנה עוד לפני שהחיה נכנסה לניסוי.
מודלי יסוד כמו NatureLM‑audio מעבירים את השאלה מסיווג מונחה ללמידת ייצוגים בקנה מידה רחב. אימון על ביואקוסטיקה, דיבור, מוזיקה ואודיו מאפשר העברת ידע למינים ולמשימות שלא הופיעו באימון. יתרון זה גם מסוכן: המבנה שהמודל מעביר עלול להגיע מן הדיבור האנושי ולהלביש על החיה קטגוריות שלא קיימות בעולמה.
השלב הבא הוא grounding רב־מודלי. קול לבדו כמעט לעולם אינו מספיק; המערכת צריכה לחבר אודיו לווידאו, מיקום, תאוצה, זהות, יחסים חברתיים, מצב הגוף ותגובת הנמען. כך נוצרת השערה על קשר בין אות לעולם. גם ייצוג רב־מודלי נשאר מתאמי עד שניסוי השמעה משנה רכיב אחד ומבודד את השפעתו.
ניסוי של אלכסנדרה הורוביץ מ־2009 המחיש את אותה סכנה אצל כלבים. ״המבט האשם״ הופיע בעיקר כאשר הבעלים נזף, גם אם הכלב לא הפר הוראה. התווית האנושית תיארה תגובה לנזיפה, לא ראיה לידיעה מוסרית על מעשה אסור שביצע קודם.
מודלים גנרטיביים מוסיפים שכבה עמוקה יותר. ZF‑AIM עובר מניתוח תצפית להשתתפות פעילה בלולאה סגורה: הוא קולט קריאה, מייצר תגובה ומודד את ההמשך. בכך הבינה המלאכותית נעשית מכשיר ניסויי ליצירת התערבויות. החיה משמשת מאמת חיצוני: תגובתה קובעת אם המבנה המתמטי תפס כלל תקשורתי או חיקה רק את פני השטח.
מתרגם המצליח לחולל תגובה נעשה טכנולוגיית השפעה. אות סינתטי יכול להרחיק פיל ממסילה, להסיט דולפין מרשת דיג או להזהיר ציפורים מפני שריפה. אותה יכולת יכולה למשוך לווייתנים לסירה, להפריע לחיזור, לפזר להקה או לסייע לציד. מסגרת PEPP שפרסמה אוניברסיטת ניו יורק ב־2025 דורשת ממשל נתונים, זהירות, שקיפות, הגנת בעלי חיים ומניעת שימוש מסחרי ופוגעני במאגרי תקשורת.
הממד המדיני עולה דווקא מתחת לפני המים. תוכנית PALS של DARPA מפתחת שימוש בתגובות אורגניזמים ימיים לזיהוי כלי שיט וצוללות. האורגניזם חש בהפרעה, מערכת מלאכותית מפרשת את תגובתו ומעבירה התרעה. ביואקוסטיקה נעשית שכבת מודיעין סביבתית. המאגר האסטרטגי כולל קול, זהות, מיקום, יחסים והתנהגות, ונבנה באמצעות גישה רצופה לשטח. מי שמחזיק בו מחזיק יכולת שקשה לשכפל.
המרחק בין חיזוי להבנה יקבע את גבולות האמינות הציבורית. חברות יוכלו לשווק תשובות רגשיות הרבה לפני שהמדע יוכל לאמת אותן. משום כך מערכת מסחרית תידרש להציג את מקור הנתונים, שיעור הטעות, תחום ההכללה והניסויים הסיבתיים שעליהם נשענת כל טענה לגבי רצון, רגש או כוונה של בעל חיים.
התרחיש הסביר לשנים הקרובות אינו אפליקציה המתרגמת שיחה פתוחה עם כלב. סביר יותר שיופיעו מילונים תפקודיים צרים: בהקשר מוגדר, אצל מין מסוים, אות מסוים מנבא פנייה לנמען או תגובה ברמת ביטחון נתונה. זו התקדמות צנועה ביחס לדמיון הציבורי, אך עמוקה מבחינה מדעית, משפטית ומוסרית. היא תעניק לאדם יכולת חדשה להקשיב, ובאותה נשימה גם יכולת חדשה להתערב.
מאריסטו ועד המרחב הסמוי, שאלת שפת בעלי החיים הייתה תמיד שאלה על האדם. אריסטו הציב גבול, דרווין הפך אותו לרצף, הפסיכולוגיה לימדה לחשוד בפרשנות והאתולוגיה החזירה את ההקשר. הבינה המלאכותית אינה מעניקה לחיה קול אנושי. היא חושפת אפשרות מטרידה יותר: הקשבנו בעיקר למה שהתאים לקטגוריות שבנינו מראש. המהפכה תתחיל כאשר המכונה תגלה הבחנה חדשה, והחיה, בהתנהגותה, תאשר שהיא הייתה שם תמיד.

עדיין אין תגובות!