Эволюция архитектур трансформеров: от самовнимания к эффективным Sparse-моделям
https://doi.org/10.21122/2309-4923-2026-2-78-81
Аннотация
Статья посвящена исследованию новых архитектур искусственных нейронных сетей, направленных на улучшение классических трансформеров путем уменьшения вычислительных затрат и увеличения эффективности. Рассматриваются основные этапы эволюции трансформеров, начиная с введения механизма самовнимания и заканчивая современными Sparse-моделями. Особое внимание уделяется методам оптимизации, таким как параметрически эффективный fine-tuning (PEFT), адаптивные слои (adapters), а также использование внешних хранилищ знаний и mem-векторов для расширения долговременной памяти моделей. Статья завершается обсуждением текущих достижений, ограничений и перспективных направлений будущих исследований в данной области.
Об авторах
В. О. ГуляевРоссия
Гуляев Владислав Олегович - Магистрант.
г. Самара
E-mail: vladislavgulaev03@gmail.com
О. И. Захарова
Россия
Захарова Оксана Игоревна
г. Самара
E-mail: o.zaharova@psuti.ru
Список литературы
1. Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A.N., et al. Attention is all you need. arXiv [Preprint]. 2017. Available from: https://arxiv.org/abs/1706.03762 (accessed 12 Jun 2026).
2. Child R., Gray S., Radford A., Sutskever I. Generating long sequences with sparse transformers. arXiv [Preprint]. 2019. Available from: https://arxiv.org/abs/1904.10509 (accessed 12 Jun 2026).
3. Hu E.J., Shen Y., Wallis P., Allen-Zhu Z., Li Y., Wang S., et al. LoRA: Low-rank adaptation of large language models. arXiv [Preprint]. 2021. Available from: https://arxiv.org/abs/2106.09685 (accessed 12 Jun 2026).
4. Bulatov A., Kuratov Y., Burtsev M.S. Recurrent memory transformer. arXiv [Preprint]. 2022. Available from: https://arxiv.org/abs/2207.06881 (accessed 12 Jun 2026).
5. Ramesh A., Pavlov M., Goh G., Scott G., Voss C., Radford A., et al. Zero-shot text-to-image generation. arXiv [Preprint]. 2021. Available from: https://arxiv.org/abs/2102.12092 (accessed 12 Jun 2026).
6. Dhariwal P., Jun H., Payne C., Kim J.W., Radford A., Sutskever I. Jukebox: A Generative model for music. arXiv [Preprint]. 2020. Available from: https://arxiv.org/abs/2005.00341 (accessed 12 Jun 2026).
7. Brown T.B., Mann B., Ryder N., Subbiah M., Kaplan J., Dhariwal P., et al. Language models are few-shot learners. arXiv [Preprint]. 2020. Available from: https://arxiv.org/abs/2005.14165 (accessed 12 Jun 2026).
Рецензия
Для цитирования:
Гуляев В.О., Захарова О.И. Эволюция архитектур трансформеров: от самовнимания к эффективным Sparse-моделям. Системный анализ и прикладная информатика. 2026;(2):78-81. https://doi.org/10.21122/2309-4923-2026-2-78-81
For citation:
Gulyaev V.O., Zakharova O.I. Evolution of transformer architectures: from self-attention to efficient sparse models. «System analysis and applied information science». 2026;(2):78-81. (In Russ.) https://doi.org/10.21122/2309-4923-2026-2-78-81
JATS XML





















