자유게시판
Anthropic은 클로드 3.5 오퍼스에 대한 학습을 마침
작성자
작성일
2024-12-12 10:44
조회
507
https://semianalysis.com/2024/12/11/scaling-laws-o1-pro-architecture-reasoning-training-infrastructure-orion-and-claude-3-5-opus-failures/#scaling-sings-odes-to-the-greatest-scaling-law-of-computing-moore%e2%80%99s-law
기본 모델이 작업을 판단하는 데 더 좋을수록, 학습을 위한 데이터 세트가 더 좋습니다. 여기에는 고유한 스케일링 법칙이 내재되어 있습니다. 이것이 우리가 "새로운 클로드 3.5 소네트"를 얻은 방법입니다. Anthropic은 클로드 3.5 오푸스에 대한 학습을 마쳤고, 적절한 스케일링을 통해 좋은 성과를 보였습니다(그렇지 않다고 주장하는 스케일링 부인론자들은 무시하세요. 이것은 FUD입니다).
하지만 Anthropic은 이를 출시하지 않았습니다. 그 이유는 Anthropic이 공개적으로 출시하는 대신 Claude 3.5 Opus를 사용하여 합성 데이터를 생성 하고 보상 모델링을 통해 사용자 데이터와 함께 Claude 3.5 Sonnet을 크게 개선했기 때문입니다. 추론 비용은 크게 변하지 않았지만 모델의 성능은 변했습니다. 3.5 Opus를 출시하는 것이 비용 측면에서 경제적으로 타당하지 않은데, 해당 3.5 Opus에서 추가 사후 학습을 통해 3.5 Sonnet을 출시하는 것과 비교했을 때 왜 3.5 Opus를 출시할까요?
더 많은 합성 데이터가 있으면 더 나은 모델이 나옵니다. 더 나은 모델은 더 나은 합성 데이터를 제공하고 선호도를 필터링하거나 평가하는 데 더 나은 판단자 역할을 합니다. 합성 데이터 사용에는 더 작은 스케일링 법칙이 많이 내재되어 있으며, 이를 모두 합쳐 더 나은 모델을 더 빨리 개발하도록 합니다.
기본 모델이 작업을 판단하는 데 더 좋을수록, 학습을 위한 데이터 세트가 더 좋습니다. 여기에는 고유한 스케일링 법칙이 내재되어 있습니다. 이것이 우리가 "새로운 클로드 3.5 소네트"를 얻은 방법입니다. Anthropic은 클로드 3.5 오푸스에 대한 학습을 마쳤고, 적절한 스케일링을 통해 좋은 성과를 보였습니다(그렇지 않다고 주장하는 스케일링 부인론자들은 무시하세요. 이것은 FUD입니다).
하지만 Anthropic은 이를 출시하지 않았습니다. 그 이유는 Anthropic이 공개적으로 출시하는 대신 Claude 3.5 Opus를 사용하여 합성 데이터를 생성 하고 보상 모델링을 통해 사용자 데이터와 함께 Claude 3.5 Sonnet을 크게 개선했기 때문입니다. 추론 비용은 크게 변하지 않았지만 모델의 성능은 변했습니다. 3.5 Opus를 출시하는 것이 비용 측면에서 경제적으로 타당하지 않은데, 해당 3.5 Opus에서 추가 사후 학습을 통해 3.5 Sonnet을 출시하는 것과 비교했을 때 왜 3.5 Opus를 출시할까요?
더 많은 합성 데이터가 있으면 더 나은 모델이 나옵니다. 더 나은 모델은 더 나은 합성 데이터를 제공하고 선호도를 필터링하거나 평가하는 데 더 나은 판단자 역할을 합니다. 합성 데이터 사용에는 더 작은 스케일링 법칙이 많이 내재되어 있으며, 이를 모두 합쳐 더 나은 모델을 더 빨리 개발하도록 합니다.
전체 0