<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD with OASIS Tables with MathML3 v1.4 20241031//EN" "https://jats.nlm.nih.gov/archiving/1.4/JATS-archive-oasis-article1-4-mathml3.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:ali="http://www.niso.org/schemas/ali/1.0/" dtd-version="1.4" article-type="research-article" xml:lang="en"><front><journal-meta><journal-title-group><journal-title xml:lang="ru">Успехи кибернетики</journal-title></journal-title-group><issn publication-format="electronic">2712-9942</issn></journal-meta><article-meta><article-categories><subj-group><subject>Other</subject></subj-group></article-categories><title-group><article-title xml:lang="ru">О возможностях современных мультимодальных трансформеров в области анализа изображений</article-title><trans-title-group xml:lang="en"><trans-title>The Potential of Current Multimodal Transformers for Image Analysis</trans-title></trans-title-group></title-group><contrib-group><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Александров</surname><given-names>П. А.</given-names></name><name xml:lang="en"><surname>Alexandrov</surname><given-names>P. A.</given-names></name></name-alternatives><xref ref-type="aff" rid="aff1"/><xref ref-type="aff" rid="aff2"/><email>Maksimova_SI@nrcki.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Прусаков</surname><given-names>А. А.</given-names></name><name xml:lang="en"><surname>Prusakov</surname><given-names>A. A.</given-names></name></name-alternatives><xref ref-type="aff" rid="aff1"/><xref ref-type="aff" rid="aff2"/><email>prusakov.s@yandex.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Антонова</surname><given-names>Г. Н.</given-names></name><name xml:lang="en"><surname>Antonova</surname><given-names>G. N.</given-names></name></name-alternatives><xref ref-type="aff" rid="aff1"/><xref ref-type="aff" rid="aff2"/><email>g_n_ant@mail.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Шахов</surname><given-names>М. Н.</given-names></name><name xml:lang="en"><surname>Shakhov</surname><given-names>M. N.</given-names></name></name-alternatives><xref ref-type="aff" rid="aff1"/><xref ref-type="aff" rid="aff2"/><email>msha@bk.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Стельмак</surname><given-names>С. Е.</given-names></name><name xml:lang="en"><surname>Stelmak</surname><given-names>S. E.</given-names></name></name-alternatives><xref ref-type="aff" rid="aff1"/><xref ref-type="aff" rid="aff2"/><email>Stelmak_SE@nrcki.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Беклемишева</surname><given-names>А. В.</given-names></name><name xml:lang="en"><surname>Beklemisheva</surname><given-names>A. V.</given-names></name></name-alternatives><xref ref-type="aff" rid="aff1"/><xref ref-type="aff" rid="aff2"/><email>Beklemisheva_AV@nrcki.ru</email></contrib><contrib contrib-type="author"><name-alternatives><name xml:lang="ru"><surname>Саркисов</surname><given-names>В. Г.</given-names></name><name xml:lang="en"><surname>Sarkisov</surname><given-names>V. G.</given-names></name></name-alternatives><xref ref-type="aff" rid="aff1"/><xref ref-type="aff" rid="aff2"/><email>Galina_Sarkisova@mail.ru</email></contrib><aff-alternatives id="aff1"><aff><institution xml:lang="en">National Research Centre “Kurchatov Institute”</institution></aff></aff-alternatives><aff-alternatives id="aff2"><aff><institution xml:lang="ru">НИЦ «Курчатовский институт»</institution></aff></aff-alternatives></contrib-group><pub-date pub-type="epub" iso-8601-date="2026-03-31"><day>31</day><month>03</month><year>2026</year></pub-date><volume>7</volume><issue>1</issue><fpage>93</fpage><lpage>103</lpage><history><date date-type="received" iso-8601-date="2025-11-23"><day>23</day><month>11</month><year>2025</year></date><date date-type="accepted" iso-8601-date="2025-12-18"><day>18</day><month>12</month><year>2025</year></date></history><self-uri xlink:href="https://ru.jcyb.ru/nisii_tech/article/view/486" xlink:title="https://ru.jcyb.ru/nisii_tech/article/view/486">https://ru.jcyb.ru/nisii_tech/article/view/486</self-uri><self-uri content-type="pdf" xlink:href="publication-f2823c87-b5f5-4b5c-bac9-25c685c0fca2.pdf" xlink:title="PDF"/><abstract xml:lang="ru"><p>в работе представлены результаты исследования возможностей анализа изображений, которые широкому кругу пользователей предоставляют два нейросетевых сервиса: ChatGPT-5 mini и DeepSeek-3.1 Thinking. Для этих сервисов в соответствии с новой методикой и на уникальной экспериментальной базе оценивалось качество формирования признаковых описаний и выявления аналогий при предъявлении всего четырех обучающих примеров для каждого из двух классов. В экспериментах из 93 предложенных уникальных и автоматически сгенерированных модифицированных тестов Бонгарда ChatGPT-5 mini успешно справился с 15 (16,1%), а DeepSeek-3.1 Thinking — с 17 (18,3%) тестами. Обосновывается утверждение, что, несмотря на несомненные достижения в области решения задачи обучения по малому числу примеров, современная технология контекстного обучения мультимодальных нейросетевых трансформеров имеет принципиальные ограничения.</p></abstract><abstract xml:lang="en" abstract-type="summary"><p>we studied the image analysis capabilities of two widely used neural network services: ChatGPT-5 mini and DeepSeek-3.1 Thinking. We measured the quality of feature generation and analogy matching using a new methodology and a unique experimental framework that employed all four training examples for each of two classes. In experiments with 93 proposed sounds and automatically generated Modified Bongard Tests, ChatGPT-5 mini completed 15 (16.1%) tests, and DeepSeek-3.1 Thinking completed 17 (18.3%). These results demonstrate that, despite clear progress in few-shot learning, current multimodal neural network transformers still face fundamental limitations in contextual learning.</p></abstract><kwd-group xml:lang="ru"><kwd>компьютерное зрение</kwd><kwd>машинное обучение</kwd><kwd>системы искусственного интеллекта</kwd><kwd>искусственные нейронные сети</kwd><kwd>анализ изображений</kwd><kwd>ChatGPT</kwd><kwd>DeepSeek</kwd><kwd>трансформеры</kwd><kwd>большие языковые модели</kwd><kwd>обучение на малом числе примеров</kwd></kwd-group><kwd-group xml:lang="en"><kwd>artificial neural networks</kwd><kwd>image analysis</kwd><kwd>ChatGPT</kwd><kwd>DeepSeek</kwd><kwd>transformers</kwd><kwd>large language models</kwd><kwd>few-shot learning</kwd><kwd>computer vision</kwd><kwd>machine learning</kwd><kwd>artificial intelligence systems</kwd></kwd-group></article-meta></front><back><ref-list><ref id="ref1"><mixed-citation publication-type="other" xml:lang="ru">GPT-5 is here – OpenAI. Режим доступа: https://openai.com/gpt-5.</mixed-citation></ref><ref id="ref2"><mixed-citation publication-type="other" xml:lang="ru">DeepSeek. Режим доступа: https://www.deepseek.com.</mixed-citation></ref><ref id="ref3"><mixed-citation publication-type="other" xml:lang="ru">Face Recognition Grand Challenge (FRGC). Режим доступа: https://www.nist.gov/programs-projects/face-recognition-grand-challenge-frgc.</mixed-citation></ref><ref id="ref4"><mixed-citation publication-type="other" xml:lang="ru">ImageNet Large Scale Visual Recognition Challenge (ILSVRC). Режим доступа: https://image-net.org/challenges/LSVRC/index.php.</mixed-citation></ref><ref id="ref5"><mixed-citation publication-type="other" xml:lang="ru">Radford А. et al. Learning Transferable Visual Models from Natural Language Supervision. International Conference on Machine Learning. 2021:8748-8763. DOI: https://doi.org/10.48550/arXiv.2103.00020.</mixed-citation></ref><ref id="ref6"><mixed-citation publication-type="other" xml:lang="ru">Бонгард М. М. Проблема узнавания. М.: Физматгиз; 1967. 320 с.</mixed-citation></ref><ref id="ref7"><mixed-citation publication-type="other" xml:lang="ru">Hofstadter D. R. Gödel, Escher, Bach: an Eternal Golden Braid. Basic books; 1999.</mixed-citation></ref><ref id="ref8"><mixed-citation publication-type="other" xml:lang="ru">Nie W. et al. Bongard-LOGO: A New Benchmark for Human-Level Concept Learning and Reasoning. Advances in Neural Information Processing Systems. 2020;33:16468-16480. Режим доступа: https://proceedings.neurips.cc/paper_files/paper/2020/file/bf15e9bbff22c7719020f9df4badc20a-Paper.pdf.</mixed-citation></ref><ref id="ref9"><mixed-citation publication-type="other" xml:lang="ru">Index of Bongard Problems. Режим доступа: https://www.foundalis.com/res/bps/bpidx.htm.</mixed-citation></ref><ref id="ref10"><mixed-citation publication-type="other" xml:lang="ru">Małkiński M., Pawlonka S., Mańdziuk J. Reasoning Limitations of Multimodal Large Language Models. A Case Study of Bongard Problems. 2024. arXiv:2411.01173. Режим доступа: https://arxiv.org/abs/2411.01173.</mixed-citation></ref><ref id="ref11"><mixed-citation publication-type="other" xml:lang="ru">IQ Test. Режим доступа: https://www.mensa.org/mensa-iq-challenge/#test.</mixed-citation></ref><ref id="ref12"><mixed-citation publication-type="other" xml:lang="ru">Tracking AI. Monitoring Artificial Intelligence. Режим доступа: https://www.trackingai.org/home.</mixed-citation></ref><ref id="ref13"><mixed-citation publication-type="other" xml:lang="ru">Chollet F. On the Measure of Intelligence. 2019. arXiv:1911.01547. Режим доступа: https://arxiv.org/pdf/1911.01547.</mixed-citation></ref><ref id="ref14"><mixed-citation publication-type="other" xml:lang="ru">Chollet F. How We Get To AGI. 2025. Режим доступа: https://www.youtube.com/watch?v=5QcCeSsNRks.</mixed-citation></ref><ref id="ref15"><mixed-citation publication-type="other" xml:lang="ru">ARC Prize 2024: Technical Report. 2024. Режим доступа: https://arcprize.org/competitions/2024/.</mixed-citation></ref><ref id="ref16"><mixed-citation publication-type="other" xml:lang="ru">Akyürek E. et al. The Surprising Effectiveness of Test-Time Training for Few-Shot Learning. 2024. arXiv:2411.07279. Режим доступа: https://arxiv.org/html/2411.07279v2.</mixed-citation></ref><ref id="ref17"><mixed-citation publication-type="other" xml:lang="ru">ARC Prize 2024. Режим доступа: https://arcprize.org/competitions/2024/.</mixed-citation></ref><ref id="ref18"><mixed-citation publication-type="other" xml:lang="ru">База данных 93 изображений тестов МТБ 2025. Режим доступа: https://disk.yandex.ru/d/SDvvt4xqDh49ZQ.</mixed-citation></ref><ref id="ref19"><mixed-citation publication-type="other" xml:lang="ru">Мясников В. В. и др. Методы обнаружения и распознавания объектов на цифровых изображениях. Самара: Изд-во СГАУ; 2006. 168 c. Режим доступа: https://repo.ssau.ru/handle/Uchebnye-posobiya/Metody-obnaruzheniya-i-raspoznavaniya-obektov-na-cifrovyh-izobrazheniyah-Elektronnyi-resurs-uchebposobie-54225.</mixed-citation></ref><ref id="ref20"><mixed-citation publication-type="other" xml:lang="ru">Copilot 3D Transforms an Image into a Usable 3D Model. Режим доступа: https://copilot.microsoft.com/labs/experiments/copilot-3d.</mixed-citation></ref></ref-list></back></article>
