최신논문
(2023년 10월) 언어모델은 공간과 시간을 표현합니다
작성자
작성일
2024-07-01 01:16
조회
424
https://arxiv.org/abs/2310.02207
LLM(대형 언어 모델)의 기능은 이러한 시스템이 엄청난 피상적 통계 모음을 학습하는지, 아니면 실제 세계를 반영하는 보다 일관되고 기초적인 표현 세트를 학습하는지에 대한 논쟁을 불러일으켰습니다. 우리는 Llama-2 모델 계열에서 세 가지 공간 데이터 세트(세계, 미국, 뉴욕 장소)와 세 가지 시간 데이터 세트(역사적 인물, 예술 작품, 뉴스 헤드라인)의 학습된 표현을 분석하여 후자에 대한 증거를 찾습니다. 우리는 LLM이 여러 규모에 걸쳐 공간과 시간의 선형 표현을 학습한다는 것을 발견했습니다. 이러한 표현은 다양한 엔터티 유형(예: 도시 및 랜드마크)에 걸쳐 통합되어 변화를 유도하는 데 강력합니다. 또한 공간적, 시간적 좌표를 안정적으로 인코딩하는 개별 "공간 뉴런"과 "시간 뉴런"을 식별합니다. 추가 조사가 필요하지만, 우리의 결과는 현대 LLM이 실제 세계에 대한 풍부한 시공간 표현을 학습하고 세계 모델의 기본 구성 요소를 보유하고 있음을 시사합니다.
LLM(대형 언어 모델)의 기능은 이러한 시스템이 엄청난 피상적 통계 모음을 학습하는지, 아니면 실제 세계를 반영하는 보다 일관되고 기초적인 표현 세트를 학습하는지에 대한 논쟁을 불러일으켰습니다. 우리는 Llama-2 모델 계열에서 세 가지 공간 데이터 세트(세계, 미국, 뉴욕 장소)와 세 가지 시간 데이터 세트(역사적 인물, 예술 작품, 뉴스 헤드라인)의 학습된 표현을 분석하여 후자에 대한 증거를 찾습니다. 우리는 LLM이 여러 규모에 걸쳐 공간과 시간의 선형 표현을 학습한다는 것을 발견했습니다. 이러한 표현은 다양한 엔터티 유형(예: 도시 및 랜드마크)에 걸쳐 통합되어 변화를 유도하는 데 강력합니다. 또한 공간적, 시간적 좌표를 안정적으로 인코딩하는 개별 "공간 뉴런"과 "시간 뉴런"을 식별합니다. 추가 조사가 필요하지만, 우리의 결과는 현대 LLM이 실제 세계에 대한 풍부한 시공간 표현을 학습하고 세계 모델의 기본 구성 요소를 보유하고 있음을 시사합니다.
전체 0