Preview

Системный анализ и прикладная информатика

Расширенный поиск

Эволюция архитектур трансформеров: от самовнимания к эффективным Sparse-моделям

https://doi.org/10.21122/2309-4923-2026-2-78-81

Аннотация

Статья посвящена исследованию новых архитектур искусственных нейронных сетей, направленных на улучшение классических трансформеров путем уменьшения вычислительных затрат и увеличения эффективности. Рассматриваются основные этапы эволюции трансформеров, начиная с введения механизма самовнимания и заканчивая современными Sparse-моделями. Особое внимание уделяется методам оптимизации, таким как параметрически эффективный fine-tuning (PEFT), адаптивные слои (adapters), а также использование внешних хранилищ знаний и mem-векторов для расширения долговременной памяти моделей. Статья завершается обсуждением текущих достижений, ограничений и перспективных направлений будущих исследований в данной области.

Об авторах

В. О. Гуляев
Поволжский государственный университет телекоммуникаций и информатики
Россия

Гуляев Владислав Олегович - Магистрант.
г. Самара
E-mail: vladislavgulaev03@gmail.com



О. И. Захарова
Поволжский государственный университет телекоммуникаций и информатики
Россия

Захарова Оксана Игоревна
г. Самара
E-mail: o.zaharova@psuti.ru



Список литературы

1. Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A.N., et al. Attention is all you need. arXiv [Preprint]. 2017. Available from: https://arxiv.org/abs/1706.03762 (accessed 12 Jun 2026).

2. Child R., Gray S., Radford A., Sutskever I. Generating long sequences with sparse transformers. arXiv [Preprint]. 2019. Available from: https://arxiv.org/abs/1904.10509 (accessed 12 Jun 2026).

3. Hu E.J., Shen Y., Wallis P., Allen-Zhu Z., Li Y., Wang S., et al. LoRA: Low-rank adaptation of large language models. arXiv [Preprint]. 2021. Available from: https://arxiv.org/abs/2106.09685 (accessed 12 Jun 2026).

4. Bulatov A., Kuratov Y., Burtsev M.S. Recurrent memory transformer. arXiv [Preprint]. 2022. Available from: https://arxiv.org/abs/2207.06881 (accessed 12 Jun 2026).

5. Ramesh A., Pavlov M., Goh G., Scott G., Voss C., Radford A., et al. Zero-shot text-to-image generation. arXiv [Preprint]. 2021. Available from: https://arxiv.org/abs/2102.12092 (accessed 12 Jun 2026).

6. Dhariwal P., Jun H., Payne C., Kim J.W., Radford A., Sutskever I. Jukebox: A Generative model for music. arXiv [Preprint]. 2020. Available from: https://arxiv.org/abs/2005.00341 (accessed 12 Jun 2026).

7. Brown T.B., Mann B., Ryder N., Subbiah M., Kaplan J., Dhariwal P., et al. Language models are few-shot learners. arXiv [Preprint]. 2020. Available from: https://arxiv.org/abs/2005.14165 (accessed 12 Jun 2026).


Рецензия

Для цитирования:


Гуляев В.О., Захарова О.И. Эволюция архитектур трансформеров: от самовнимания к эффективным Sparse-моделям. Системный анализ и прикладная информатика. 2026;(2):78-81. https://doi.org/10.21122/2309-4923-2026-2-78-81

For citation:


Gulyaev V.O., Zakharova O.I. Evolution of transformer architectures: from self-attention to efficient sparse models. «System analysis and applied information science». 2026;(2):78-81. (In Russ.) https://doi.org/10.21122/2309-4923-2026-2-78-81

Просмотров: 118

JATS XML


Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 2309-4923 (Print)
ISSN 2414-0481 (Online)