Benchmark Contamination과 Double-Blind Evaluation 새로운 AI 모델이 공개될 때마다 다양한 벤치마크 점수가 함께 발표됩니다. 추론, 수학, 코딩, 안전성 등 모델의 능력을 하나의 숫자로 비교할 수 있기 때문에 벤치마크는 AI 모델의 성능을 판단하는 대표적인 기준으로 활용되고 있습니다. 하지만 모델의 학습 데이터가 점점 방대해지면서 한 가지 질문이 중요해지고 있습니다. 모델이 평가 문제를 이미 본 적이 있다면, 그 …
AI 모델의 성능, 우리는 제대로 평가하고 있을까? 더 보기 »
||

