최신논문
신경망의 구조적 구성성에 대한 증거
작성자
작성일
2024-07-03 20:58
조회
352
https://arxiv.org/abs/2301.10884
현대 신경망은 시각 및 언어 작업에서 인상적인 성과를 달성했지만, 신경망이 구현하는 기능에 대해서는 거의 알려져 있지 않습니다. 한 가지 가능성은 신경망이 암묵적으로 복잡한 작업을 하위 루틴으로 분해하고, 이러한 하위 루틴에 대한 모듈식 솔루션을 구현하고, 이를 작업에 대한 전체 솔루션으로 구성한다는 것입니다. 이를 구조적 구성성이라고 합니다. 또 다른 가능성은 신경망이 단순히 새로운 입력을 학습된 템플릿에 맞춰 학습하여 작업 분해를 완전히 생략하는 것입니다. 여기에서는 모델 가지치기 기술을 활용하여 다양한 아키텍처, 작업 및 사전 학습 체계에서 시각과 언어 모두에서 이 문제를 조사합니다. 우리의 결과는 모델이 종종 모듈식 하위 네트워크를 통해 하위 루틴에 대한 솔루션을 구현하며, 이는 다른 하위 네트워크의 기능을 유지하면서 제거될 수 있음을 보여줍니다. 이는 신경망이 구성성을 학습하여 특수한 기호 메커니즘의 필요성을 없앨 수 있음을 시사합니다.
현대 신경망은 시각 및 언어 작업에서 인상적인 성과를 달성했지만, 신경망이 구현하는 기능에 대해서는 거의 알려져 있지 않습니다. 한 가지 가능성은 신경망이 암묵적으로 복잡한 작업을 하위 루틴으로 분해하고, 이러한 하위 루틴에 대한 모듈식 솔루션을 구현하고, 이를 작업에 대한 전체 솔루션으로 구성한다는 것입니다. 이를 구조적 구성성이라고 합니다. 또 다른 가능성은 신경망이 단순히 새로운 입력을 학습된 템플릿에 맞춰 학습하여 작업 분해를 완전히 생략하는 것입니다. 여기에서는 모델 가지치기 기술을 활용하여 다양한 아키텍처, 작업 및 사전 학습 체계에서 시각과 언어 모두에서 이 문제를 조사합니다. 우리의 결과는 모델이 종종 모듈식 하위 네트워크를 통해 하위 루틴에 대한 솔루션을 구현하며, 이는 다른 하위 네트워크의 기능을 유지하면서 제거될 수 있음을 보여줍니다. 이는 신경망이 구성성을 학습하여 특수한 기호 메커니즘의 필요성을 없앨 수 있음을 시사합니다.
전체 0