{"id":33939,"date":"2026-01-26T15:05:03","date_gmt":"2026-01-26T15:05:03","guid":{"rendered":"https:\/\/lamarr-institute.org\/?p=33939"},"modified":"2026-03-13T07:31:11","modified_gmt":"2026-03-13T07:31:11","slug":"skalierungsgesetze-emergenter-mehrsprachigkeit-in-vision-language-modellen","status":"publish","type":"post","link":"https:\/\/lamarr-institute.org\/de\/news\/skalierungsgesetze-emergenter-mehrsprachigkeit-in-vision-language-modellen\/","title":{"rendered":"Skalierungsgesetze emergenter Mehrsprachigkeit in Vision-Language-Modellen"},"content":{"rendered":"\n<p>Wie und unter welchen Bedingungen <strong>emergente F\u00e4higkeiten in Vision-Language-Modellen entstehen<\/strong>, ist eine zentrale Frage der aktuellen KI-Forschung. In der Studie <a href=\"https:\/\/arxiv.org\/abs\/2503.09443\" target=\"_blank\" rel=\"noopener\"><em>\u201eScaling Laws for Conditional Emergence of Multilingual Image Captioning via Generalization from Translation\u201c<\/em> <\/a>werden <strong>empirische Skalierungsgesetze<\/strong> beschrieben, die erkl\u00e4ren, wann Modelle in der Lage sind, Bilder in neuen Sprachen zu beschreiben, obwohl daf\u00fcr keine entsprechenden Bild-Text-Daten vorliegen.<\/p>\n\n\n\n<p>Die Arbeit zeigt, dass mehrsprachige Bildbeschreibung als conditional emergence aus der Kombination visueller Bildbeschreibung in einer Sprache und rein textbasierter mehrsprachiger \u00dcbersetzungsdaten hervorgehen kann. Entscheidend ist dabei die Skalierung des Trainingssettings: Modellgr\u00f6\u00dfe, Umfang der \u00dcbersetzungsdaten und sprachliche Vielfalt bestimmen gemeinsam, ob und wie stabil diese F\u00e4higkeit auftritt.<\/p>\n\n\n\n<p>Die Ergebnisse sind vor dem Hintergrund aktueller Forschungsdebatten besonders relevant \u2013 etwa zur Generalisation \u00fcber Modalit\u00e4ten und Sprachen hinweg, zu Low-Resource-Ans\u00e4tzen f\u00fcr globale KI sowie zu effizienteren Alternativen gegen\u00fcber aufwendiger multimodaler Datenerhebung.<\/p>\n\n\n\n<p>Die Modelle werden auf etablierten Benchmarks wie Multi30K, COCO Karpathy, XM3600 und CoMMuTE evaluiert und zeigen dort eine konsistente \u00dcbertragungsleistung bei multimodalen Sprachaufgaben. Die Studie verdeutlicht damit, dass emergente multimodale F\u00e4higkeiten nicht zuf\u00e4llig entstehen, sondern eng an klar beschreibbare Skalierungseffekte gekoppelt sind.<\/p>\n\n\n\n<p>An der Arbeit beteiligt ist <a href=\"https:\/\/lamarr-institute.org\/de\/person\/prof-dr-sven-behnke\/\"><strong>Prof. Dr. Sven Behnke<\/strong><\/a>, Principal Investigator und Area Chair Embodied AI am <strong>Lamarr-Institut f\u00fcr Maschinelles Lernen und K\u00fcnstliche Intelligenz<\/strong>. Die Studie adressiert zentrale Fragestellungen zu Emergenz, Generalisation und Skalierung in komplexen KI-Systemen. Die Ergebnisse werden auf der AAAI Conference on Artificial Intelligence von Julian Spravil, Research Engineer am Lamarr-Partnerinstitut <a href=\"https:\/\/www.iais.fraunhofer.de\/\" target=\"_blank\" rel=\"noopener\"><strong>Fraunhofer-Institut f\u00fcr Intelligente Analyse- und Informationssysteme IAIS<\/strong><\/a>, vorgestellt.<\/p>\n\n\n\n<div class=\"wp-block-buttons is-layout-flex wp-block-buttons-is-layout-flex\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/arxiv.org\/abs\/2503.09443\" target=\"_blank\" rel=\"noopener\">Zur Studie &#8222;Scaling Laws for Condtional Emergence of Multilingual Image Captioning&#8220;<\/a><\/div>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Eine neue Studie identifiziert Skalierungsgesetze, die erkl\u00e4ren, wie Vision-Language-Modelle emergente mehrsprachige Bildbeschreibungsf\u00e4higkeiten durch Generalisierung aus \u00dcbersetzungsdaten entwickeln \u2013 auch ohne explizite multimodale Supervision.<\/p>\n","protected":false},"author":28,"featured_media":33936,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":""},"categories":[174,175],"tags":[],"class_list":["post-33939","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-pressemitteilungen","category-wissenschaft"],"acf":[],"publishpress_future_workflow_manual_trigger":{"enabledWorkflows":[]},"_links":{"self":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/posts\/33939","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/users\/28"}],"replies":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/comments?post=33939"}],"version-history":[{"count":0,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/posts\/33939\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media\/33936"}],"wp:attachment":[{"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/media?parent=33939"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/categories?post=33939"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/lamarr-institute.org\/de\/wp-json\/wp\/v2\/tags?post=33939"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}