최신논문
잠재 변수 추론을 통한 사고 사슬 훈련
작성자
작성일
2024-07-03 23:36
조회
337
https://arxiv.org/abs/2312.02179
대규모 언어 모델(LLM)은 ``생각의 사슬''(CoT) 프롬프트를 사용하여 단계별로 답을 구하도록 지시받을 때 문제를 더 정확하고 해석 가능하게 해결합니다. 또한, 일부 조정 가능한 매개변수에 그래디언트 상승을 사용하여 레이블이 지정된 학습 세트에서 정답의 평균 로그 우도를 최대화하는 감독 미세 조정을 통해 특정 작업에 대한 LLM의 성능을 개선할 수 있습니다. CoT를 감독 조정과 순진하게 결합하려면 정답뿐만 아니라 해당 답으로 이어지는 자세한 근거에 대한 감독도 필요합니다. 이러한 근거는 수작업으로 생성하는 데 비용이 많이 듭니다. 대신, CoT 프롬프트를 사용하여 정답을 생성하는 \emph{marginal} 로그 우도를 최대화하려는 미세 조정 전략을 제안하여 모든 가능한 근거에 대해 대략 평균을 내는 것입니다. 핵심 과제는 정답에 따라 조건부 근거에 대한 사후 샘플링입니다. 우리는 자기 학습 추론자(STaR), 메모화된 각성-수면, 마르코프 스코어 클라이밍, 지속적인 대조적 발산에서 영감을 얻은 간단한 마르코프-체인 몬테카를로(MCMC) 기대-최대화(EM) 알고리즘을 사용하여 이를 해결합니다. 이 알고리즘은 또한 모델이 개선됨에 따라 기울기 추정치의 분산을 0으로 만드는 새로운 제어 변수 기술을 허용합니다. GSM8K와 BIG-Bench Hard의 작업에 기술을 적용하면 이 MCMC-EM 미세 조정 기술이 일반적으로 CoT가 있거나 없는 STaR 또는 프롬프트 조정보다 보류된 예제에서 모델의 정확도를 더 향상시킨다는 것을 알 수 있습니다.
대규모 언어 모델(LLM)은 ``생각의 사슬''(CoT) 프롬프트를 사용하여 단계별로 답을 구하도록 지시받을 때 문제를 더 정확하고 해석 가능하게 해결합니다. 또한, 일부 조정 가능한 매개변수에 그래디언트 상승을 사용하여 레이블이 지정된 학습 세트에서 정답의 평균 로그 우도를 최대화하는 감독 미세 조정을 통해 특정 작업에 대한 LLM의 성능을 개선할 수 있습니다. CoT를 감독 조정과 순진하게 결합하려면 정답뿐만 아니라 해당 답으로 이어지는 자세한 근거에 대한 감독도 필요합니다. 이러한 근거는 수작업으로 생성하는 데 비용이 많이 듭니다. 대신, CoT 프롬프트를 사용하여 정답을 생성하는 \emph{marginal} 로그 우도를 최대화하려는 미세 조정 전략을 제안하여 모든 가능한 근거에 대해 대략 평균을 내는 것입니다. 핵심 과제는 정답에 따라 조건부 근거에 대한 사후 샘플링입니다. 우리는 자기 학습 추론자(STaR), 메모화된 각성-수면, 마르코프 스코어 클라이밍, 지속적인 대조적 발산에서 영감을 얻은 간단한 마르코프-체인 몬테카를로(MCMC) 기대-최대화(EM) 알고리즘을 사용하여 이를 해결합니다. 이 알고리즘은 또한 모델이 개선됨에 따라 기울기 추정치의 분산을 0으로 만드는 새로운 제어 변수 기술을 허용합니다. GSM8K와 BIG-Bench Hard의 작업에 기술을 적용하면 이 MCMC-EM 미세 조정 기술이 일반적으로 CoT가 있거나 없는 STaR 또는 프롬프트 조정보다 보류된 예제에서 모델의 정확도를 더 향상시킨다는 것을 알 수 있습니다.
전체 0