본문 바로가기

자연어처리/Reasoning

[MathScale] Scaling Instruction Tuning for Mathematical Reasoning

■ LLM은 problem-solving에서 뛰어난 능력을 보여 왔지만, 여전히 mathematical problems을 해결하는 능력은 부족하다. 

■ 저자들은 LLM(예: GPT-3.5)을 사용하여 high-quality mathematical reasoning data를 생성하는 단순하면서도 scalable한 방법인 MathScale을 제안한다.  

■ MathScale은 사람의 수학 학습에서 나타나는 인지적 메커니즘에서 영감을 받은 방법으로, 먼저 seed math questions에서 topics과 knowledge points를 추출한다.  

■ 그런 다음, 이를 바탕으로 concept graph를 만들고, 이 graph를 사용해 새로운 수학 문제를 생성한다.

■ 200만 개의 math question-answer pairs을 포함하는 mathematical reasoning dataset인 MathScaleQA를 구축했으며, LLM의 mathematical reasoning ability를 종합적으로 평가하기 위해 K-12, 대학 및 경시대회 수준의 수학 문제를 포괄하는 10개의 dataset의 모음인 Math Word Problem benchmark인 MWPBENCH를 구축했다. 

■ MathScaleQA를 사용하여 LLaMA-2와 Mistral 같은 open-source LLM을 fine-tuning했으며, 그 결과 mathematical reasoning ability가 유의미하게 향상되었다. MWPBENCH에서 평가했을 때, MathScale-7B는 모든 dataset에 걸쳐 SOTA를 달성했다.   

[2403.02884] MathScale: Scaling Instruction Tuning for Mathematical Reasoning

 

MathScale: Scaling Instruction Tuning for Mathematical Reasoning

Large language models (LLMs) have demonstrated remarkable capabilities in problem-solving. However, their proficiency in solving mathematical problems remains inadequate. We propose MathScale, a simple and scalable method to create high-quality mathematica

arxiv.org

 

1. Introduction

■ LLM은 problem-solving에서 뛰어난 능력을 보여 왔다. 그러나 수학 문제를 해결하는 능력은 여전히 부족하며, 이는 mathematical problem-solving에 본질적으로 여러 단계의 complex reasoning이 필요하기 때문일 수 있다. 

■ instruction tuning은 LLM 안에 잠재되어 있는 일부 능력을 끌어내는 효과적인 접근법이다.

■ 그러나 현재 이용 가능한 mathematical reasoning dataset의 규모가 제한적이기 때문에, instruction tuning이 효과적이더라도, 학습에 쓸 수 있는 data가 충분하지 않아 성능 향상에 제약을 받는다.  
- 예를 들어 가장 널리 사용되는 math datasets인 GSM8K와 MATH는 각각 약 7.5K training examples만을 포함하고 있다.  

■ 이 문제를 해결하는 효과적인 방법은 GPT-3.5와 GPT-4 같은 frontier LLM을 사용해, 기존의 high-quality math datasets을 증강하는 것이다.  

■ 예를 들어 WizardMath는 GPT-3.5가 더 어렵고 복잡한 수학 문제를 생성하도록 하기 위해 여러 operations을 도입한다. MetaMath는 answer augmentation, question rephrasing, self-verification, FOBAR questions을 통해 GSM8K와 MATH의 문제를 bootstrap한다. 

■ 다만, 이러한 방법으로 새로 생성된 examples은 training set 안의 original examples과 상당히 유사한 경향이 있다. 즉, 대규모 math dataset의 data diversity를 제한할 수 있다. 

■ 이에 저자들은 original training examples에 덜 의존하는, 간단하고 확장 가능한 방법인 MathScale을 제안한다.

■ 구체적으로, 먼저 GPT-3.5에게 기존 seed math question에서 high-level concept, 즉 topic과 knowledge point를 추출하도록 한다. 

■ 추출 결과를 바탕으로 concept graph를 만들며, 이 graph는 서로 다른 concept 사이의 연결 관계를 추정하는 데 사용된다.

■ 마지막으로 graph에서 무작위로 sample한 concepts을 바탕으로 GPT-3.5가 새로운 수학 문제를 생성하도록 지시한다. 이러한 과정을 통해 원래 문제에 대한 의존성을 상당 부분 제거힐 수 있다.  

■ 직관적으로, concepts의 서로 다른 조합을 사용하면 augmentation-based method보다 훨씬 더 많은 examples을 생성할 수 있다. augmentation-based method에서 생성 가능한 새로운 examples의 범위는 사용할 수 있는 augmentation operation의 개수에 의해 제한되기 때문이다. 

■ MathScale은 인간의 수학 학습 과정에 깔린 인지적 메커니즘과도 유사한 점이 있다. 

■ How humans learn to think mathematically: Exploring the three worlds of mathematics에서는 인간의 학습 과정이 concept compression과 connection forging이라는 두 가지 구별되는 단계를 포함한다고 주장한다. 

■ concept compression은 high-level concept extraction 과정과 대응되며, connection forging은 저자들의 concept graph construction과 유사하다. 

■ mathematical capability를 평가하는 것 역시 high-quality mathematical dataset의 부족에서 비롯되는 또 다른 문제다.

■ 최근 많은 LLM은 평가를 위해 GSM8K와 MATH를 사용한다. 그러나 GSM8K는 초등 수준 문제에 초점을 맞추는 반면, MATH는 수학 경시대회 수준의 challenge를 제공한다. 즉, 두 benchmark가 측정하는 능력 사이에는 분명한 간격이 존재한다. 

■ 이에 저자들은 mathematical reasoning capability를 측정하기 위한 포괄적이고 통일된 benchmark인 MWPBENCH를 제안한다. 

■ MWPBENCH는 GSM8K와 MATH를 포함한 10개의 서로 다른 math word problem dataset으로 구성되며, 초등학교부터 대학 수준까지 다양한 난이도의 math word problem을 포괄한다. 

■ 또한 MWPBENCH는 unified protocol로 모든 dataset의 evaluation을 표준화하여, 일관되고 공정한 model comparison이 가능하다.  



2. MWPBENCH Evaluation Framework


2.1 MWPBENCH

Existing Datasets

■ GSM8K, MATH, TAL-SCQ, Math23k, Ape210k, GaokaoBench-Math, 그리고 AGIEval 시리즈를 포함하여 기존에 확립된 데이터셋들을 취합한다. (Table 1) 

■ 이 데이터셋들의 문제 유형은 서로 다르다. 예를 들어 대부분의 데이터셋은 math word problems을 포함하지만, TAL-SCQ는 multi-choice questions로 구성되어 있습니다. 

■ multi-choice question은 LLM이 모델이 문제를 완전히 풀지 못하고, 단순히 더 높은 확률의 선택지를 선택할 수 있다. 그래서 저자들은 모든 multi-choice questions을 math word problems 형태로 변환했다. (Appendix A.1) 

■ 그리고 일부 데이터셋(예: Math23k, Ape210k)은 영어가 아니다. 이에 저자들은 기존 수학 데이터셋을 확장하기 위해 이를 영어로 번역했다. (Appendix A.2) 

CollegeMath

■ 기존 데이터셋들은 analytical thinking, logical reasoning, quantitative analysis과 같은 다양한 스킬들을 요구하는 college-level의 mathematics을 다루지 않는다. 저자들은 이 간극을 메우기 위해 CollegeMath를 제안한다.  

■ 각각 서로 다른 주제를 다루는 9권의 대학 수학 교재 collection을 큐레이션했다. (Table 2)

■ 이 교재들은 대수학, 기초 미적분학, 미적분학, 벡터 미적분학, 확률, 선형대수, 미분 방정식이라는 7개의 분야를 다룬다. 저자들은 교재 PDF들에 대해, 수식을 LaTeX 형식으로 변환해 주는 Mathpix API를 사용하여 이를 텍스트 형식으로 변환했다.  

■ 그런 다음 연습문제 내의 질문들과 그에 관련된 정답을 추출했다 (Appendix A.3). 결과적으로 이 데이터셋은 총 1,281개의 training examples과 2,818개의 test examples을 포함한다. 


2.2 Unified Evaluation Protocol

■ LLM의 mathematical reasoning을 benchmark할 때의 한 가지 문제는, 서로 다른 연구들이 서로 다른 evaluation metric과 protocol을 사용한다는 점이다. 

■ MWPBENCH는 unified evaluation protocol을 사용하여 instruction-tuned LLM의 mathematical reasoning ability를 평가하는 것을 목표로 한다. 

■ 저자들은 evaluation에서 zero-shot setting을 사용하고, accuracy metric을 사용한다. 그 이유는 fine-tuned LLM이 demonstration 없이도 질문에 직접 답할 수 있어야 한다고 보기 때문이며, few-shot setting에서는 어떤 demonstration set을 넣느냐에 따라 최종 결과가 달라질 수 있기 때문이다. 

■ prompt template로는 instruction tuning에서 가장 널리 사용되는 Alpaca template을 기본값으로 선택한다. 단, LLM이 다른 instruction template, 예를 들어 OpenAI ChatGPT template으로 학습된 경우를 대비하여 customized template도 지원한다. 

■ decoding에서는 comparison의 randomness를 제거하기 위해 greedy decoding을 선택하며, top-1 completion을 solution으로 사용한다. 

■ 평가를 더 표준화하기 위해 high-precision fuzzy match를 포함한 answer extraction 및 verification process를 구현했다.



3. MathScale: Scaling Instruction Tuning for Mathematical Reasoning


3.1 Concept Extraction

■ MathScale은 seed math questions을 입력으로 받으며, MWPBENCH의 training set(약, 20K math questions)을 사용한다.  

■ 첫 번째 단계에서는 GPT-3.5의 prompt engineering을 사용하여, seed questions에서 high-level concepts(topics and knowledge points)을 추출한다.  

■ 저자들은 특정 수학 문제를 푸는 데 필요한 meta information을 추출하고자 했고, topic과 knowledge point가 문제를 위한 중요한 meta information이라고 본다. 

■ 여기서 "topic"이란 "화폐와 금융" 또는 "산술 연산"과 같은 수학 과목명이나 수학 교재의 챕터 이름을 의미한다. 

■ 반면 "knowledge point"는 문제 해결에서 필요한 math concepts (예: theorems, skills)을 의미한다. 예를 들어 "내적의 정의와 성질" 또는 "분수를 정수로 변환하기" 같은 것이다. 

■ 저자들은 GPT-3.5에게 Math teacher 역할을 하도록 지시하고, 주어진 seed question에서 1개 또는 2개의 topic과 1개에서 5개의 knowledge point를 추출했다.  

■ 추출된 topic과 knowledge point의 다양성을 위해, 서로 다른 source의 question을 포함하는 MWPBENCH training set을 사용한다. 

■ 또한, noise를 줄이기 위해 한 번만 등장한 topic과 knowledge point는 제거한다. 결과적으로 약 2K topics과 8K knowledge points을 추출했다.  


3.2 Concept Graph Construction

Concept Graph

■ 추출한 topics과 knowledge points를 바탕으로 concept graph \( \mathcal{C}$ \)를 구축한다. 이 graph의 nodes은 추출된 topics \( \mathbb{T} = \{\mathbf{t}_1, \mathbf{t}_2, \ldots, \mathbf{t}_{|\mathbb{T}|}\} \)와 knowledge points (KPs) \( \mathbb{K} = \{\mathbf{k}_1, \mathbf{k}_2, \ldots, \mathbf{k}_{|\mathbb{K}|}\} \)로 구성된다.  

■ 이 graph에는 topic to topic edge, topic to KP edge, KP to KP edge라는 세 종류의 edges이 있다 (Fig 2). 이에 따라 topic graph, topic-KP graph, KP graph라는 세 개의 sub-graph들이 생성된다.  

■ 어떤 topic(또는 KP) \( \mathbf{u} \)가 다른 topic(또는 KP) \( \mathbf{v} \)와 함께 등장하면, 두 node 사이에 edge를 만든다. 그리고 그 edge의 weight는 두 concept의 co-occurrence statistics이다.  

■ 저자들은 "co-occurrence"를 \( \mathbf{u} \)와 \( \mathbf{v} \)가 동일한 seed question에서 추출된 경우로 정의한다.  

■ \( E = \{(\mathbf{u}, \mathbf{v}) | f_{co}(\mathbf{u}, \mathbf{v}) > 0\} \)를 graph \( \mathcal{C} \)의 edge 집합으로 정의하며, \( f_{co}(\mathbf{u}, \mathbf{v}) \)를 \( \mathbf{u} \)와 \( \mathbf{v} \) 사이의 edge weight다.  

■ 두 개의 KPs(또는 topics)이 동일한 seed question을 푸는 데 자주 함께 사용되었다면, 이 둘은 합리적인 composition일 가능성이 높다. 

■ adjusted weight \( f_{co}(\mathbf{u}, \mathbf{v}) \)는 다음과 같이 정의된다. 

■ 여기서 \( w_{\mathbf{uv}} \)는 node \( \mathbf{u} \)와 node \( \mathbf{v} \) 사이의 raw co-occurrence count를 나타낸다.   

■ \( \varepsilon \)는 영(0)이 아닌 count를 유지하고 계산상의 문제를 방지하기 위해 사용하는 작은 상수이다. 

Concept Composition

■ graph \( \mathcal{C} \)가 주어지면, 그 graph로부터 topics과 KPs을 샘플링한다. 샘플링된 topics과 KPs은 이후 새로운 수학 문제를 생성하는 데 사용된다.  

■ 저자들은 concept compositions을 만들기 위해 graph random walk 알고리즘을 사용한다.

■ 먼저 추출한 \( | \mathbb{T} | \)개의 topics 가운데 하나를 uniformly random sampling하는 것으로 시작한다. 실제 구현에서는 추출된 topics을 여러 epochs에 걸쳐 단순히 나열한다. 

■ 두 번째 단계에서는, 관련된 topics을 찾기 위해 topic sub-graph에서 1~2 step의 random walk를 수행한다. 이 graph random walk의 확률분포는 uniform하지 않으며 다음과 같이 정의된다. 

■ 여기서 \( \mathcal{N}(\mathbf{u}) \)는 topic sub-graph에서 \( \mathbf{u} \)와 인접한 node들의 집합이다. 

■ 세 번째 단계에서는, topic-KP graph에서 식 (2)에 따라 계산된 확률분포를 사용하여 hybrid topic-KP graph를 한 step random walk를 계속 수행한다. 그 결과 샘플링된 1개의 KP를 얻게 된다.  

■ 마지막 단계에서는, KP graph에서 식 (2)의 확률분포를 사용하여 0~4 step random walk를 수행한다. 이를 통해 더 많은 KPs로 확장한다.  

■ 최종적으로 샘플링된 topics의 집합 \( \hat{\mathbb{T}} \)와 샘플링된 KPs의 집합 \( \hat{\mathbb{K}} \)를 얻는다.  


3.3 Mathematical Reasoning Data Generation

■ topics \( \hat{\mathbb{T}} \)와 KPs \( \hat{\mathbb{K}} \)를 바탕으로, GPT-3.5에게 이에 대응하는 question-answer pairs을ㅅ 생성하도록 요청한다. 

■ 저자들은 수학 교사가 기존 연습문제를 바탕으로 새로운 문제를 설계하는 방식에서 영감을 받아, GPT-3.5가 문제를 구성할 때 이를 guide하도록 few-shot examples을 포함시켰다.  

■ 이 examples은 knowledge points 집합의 Jaccard distance를 바탕으로 seed questions 중에서 선택된다. 

■ GPT-3.5는 \( \hat{\mathbb{T}} \)를 고수할 것과 \( \hat{\mathbb{K}} \)를 결합하여 사용하도록 유도된다. 



4. Experiments


4.1 Implementation

Data Generation

■ concept extraction (섹션 3.1)에서 약 20K 개의 questions로 구성된 MWPBENCH training set을 MathScale pipeline의 seed questions로 사용하고, extraction에는 GPT-3.5-Turbo-0613을 사용한다.  

■ 최종적으로 2,018개의 topic과 8,892개의 knowledge point를 얻는다. 이후 이 concepts 사이의 관계를 설정하기 위해 graph를 구축한다. (섹션 3.2) 

■ graph의 edge weight는 식(1)을 사용하며, \( \varepsilon = 1e-5 \)를 사용한다.  

■ concept composition 과정에서 모든 topic node를 한 번 순회하는 것을 한 epoch로 간주한다. 이 과정을 약 1K epochs 동안 반복하여 2 million 개의 고유한concept compositions을 만든다. 

■ 그다음 GPT-3.5-Turbo-0613에게 이 concept compositions을 바탕으로 2 million 개의 question-answer pairs을 생성하도록 지시한다. 

■ MWPBENCH test set에 있는 모든 수학 문제를 제외했으며, 생성된 dataset에 decontamination을 적용한다. 

■ high quality math reasoning data를 활용하기 위해, 생성한 data에 MWPBENCH training set을 추가로 결합한다. 이렇게 만들어진 dataset을 MathScaleQA라고 부른다.  

Model Training

■ MathScaleQA의 questions은 다음과 같은 Alpaca prompt를 사용해 format한다.

■ LLaMA-2 7B, LLaMA-2 13B, Mistral 7B를 backbone model로 사용한다. batch size 128을 사용하고, learning rate 2e-5로 MathScaleQA dataset에서 3 epochs 동안 학습한다. 

■ 이 학습을 통해 얻은 model을 MathScale-7B, MathScale-13B, MathScale-Mistral-7B라고 부른다.


4.2 Models in Comparison

 포괄적인 평가를 위해, mathematical reasoning에 특화된 다양한 기존 LLM을 비교 대상으로 선택한다.

Close-Source Models

■ GPT-3.5-Turbo-0613와 GPT-4-0314를 사용한다. 이 모델들은 mathematical reasoning에 강한 것으로 알려져 있으며, 상한선 역할을 한다. 

Open-Source Models

■ WizardMath, GAIR-Abel, MetaMath, MAmmoTH와 비교한다. 

- WizardMath는 evol-instruct와 reinforcement learning에 기반한다. 
- MetaMath는 GSM8K 및 MATH를 answer 측면 또는 question 측면에서 paraphrasing하여 증강한 dataset으로 학습되었다. 
- MAmmoTH를 학습시키는 데 사용된 dataset은 GPT-4 CoT 및/또는 PoT annotations이 달린 13개의 기존 수학 dataset이다. 

■ 저자들은 모든 model을 자연어 형태의 CoT 수학 풀이를 사용하여 평가한다.

■ GPT-4와 MAmmoTH 같은 일부 model은 자연어 풀이뿐 아니라 수학 문제의 code solution도 생성할 수 있음을 확인했다. 이에 공정한 비교를 위해 code-interpreter style solution을 사용한 비교를 하지 않는다. 

■ mathematical reasoning을 다루는 10개 dataset으로 구성된 MWPBENCH에서 모든 model을 평가한다. 이때 Alpaca template을 사용하여 모든 모델에 프롬프팅을 한다. 

■ 추론 중에 개선된 프롬프트를 사용할 것을 권장한 연구가 있었지만(표준 Alpaca 템플릿 뒤에 Let's think step by step을 추가), 저자들은 비교 대상인 모든 모델에 대해 이 방법을 사용하지 않는다. 비교 대상 model 일부에서 MWPBENCH 기준 mixed result를 관찰했기 때문이다. 예를 들어 GSM8K에서는 성능이 향상됐지만, MATH에서는 성능이 감소하는 경우가 있었다. 


4.3 Main Results

■ MathScale은 LLaMA-2 7B, LLaMA-2 13B, 또는 Mistral 7B를 기반으로 한 다른 모델들과 비교했을 때 MWPBENCH에서 가장 높은 micro average와 macro average score를 얻는다. (Table 5) 

■ 구체적으로 MathScale-7B는 MWPBENCH 전체에서 micro accuracy 35.0%, macro accuracy 37.5%를 달성했으며, 같은 규모의 가장 좋은 경쟁 모델보다 각각 42.9%, 43.7% 더 높은 성능을 보였다. 

■ 이 결과는 backbone model과 무관하게 MathScaleQA dataset이 효과적임을 확인해 준다.

■ GaokaoBench-Math, AGIEval-Gaokao-MATH, AGIEval-SAT-MATH에는 training set이 없다. 이런 out-of-domain test set에서도 MathScale-7B는 비교 대상 open-source model보다 매우 크게 앞선다.  

■ Frontier LLM과 비교했을 때 MathScale-Mistral은 GPT-3.5-Turbo와 비교하여 micro 및 macro average에서 비슷한 수준의 성능을 보인다. 



5. Analysis and Discussions


5.1 Scaling Property of MathScale

■ 고정된 math concepts이 주어져도 concept graph를 반복적으로 순회하면 서로 다른 수학 concept 조합을 만들 수 있고, 이를 통해 대량의 새로운 수학 데이터를 만들 수 있다. 

■ 저자들은 MathScale의 scaling property를 연구하기 위해 LLaMA-2 7B를 base model로 사용한다.

■ MathScaleQA dataset의 크기를 늘렸을 때, MWPBENCH의 모든 dataset에서 MathScale-7B 성능이 거의 logarithmic하게 증가하는 것을 Fig 3에서 볼 수 있다.  
또한 MathScale을 WizardMath 및 MetaMath와 각각의 training size에서 비교했을 때, MathScale은 같은 양의 training data를 사용할 때 GSM8K를 제외한 모든 dataset에서 WizardMath와 MetaMath를 능가한다. 


5.2 Ablationon Concept Extraction

(1) seed question의 수가 중요한가 (2) 추출된 concepts의 수가 중요한가에 대해 실험한다.  

Number of Seed Questions

■ seed question의 영향을 평가하기 위해, 먼저 MWPBENCH training set에서 seed questions의 50%를 무작위로 제거하여 약 10K 만 사용한다. 

■ MWPBENCH에서 macro average가 감소하며, seed question의 data source를 GSM8K와 MATH training set으로만 제한하면, 성능이 3.5% 감소한다. 이 결과들은 더 크고 더 다양한 seed question 집합을 사용하는 것이 유익함을 보여 준다. 

Number of Math Concepts

■ topic 또는 knowledge point의 절반을 제거하면  MWPBENCH에서 macro average가 감소한다. 

■ 특히 knowledge point를 제거하면 성능 감소가 더 컸다. knowledge point의 50%를 제거했을 때는 -8.6%, topic의 50%를 제거했을 때는 -2.3%였다. 이는 knowledge point가 MathScale의 효과를 높이는 데 핵심적 역할을 한다는 점을 보여 준다. 


5.3 On Validating Generated Data

■ MathScaleQA에서 생성된 QA pairs에는 틀린 내용이 있을 수 있다. 저자들은 MathScaleQA의 생성 data 5K를 대상으로 controlled experiment를 설계하고, LLaMA-2 7B를 base model로 사용한다. 

GPT-4 v.s. GPT-3.5 Accuracy

 무작위로 고른 generated data 100개를 manually annotation하고, GPT-3.5-Turbo와 GPT-4가 생성한 답을 평가했다. GPT-4는 87% accuracy로, GPT-3.5-Turbo의 69%보다 높았다. 

 그래서 GPT-4가 reference solution을 생성하게 하고, 이를 사용해 synthetic solution을 검증했다. 틀린 solution은 GPT-4 reference solution으로 교체했다.

Results

■ 5K example 가운데 26%의 solution이 GPT-4에 의해 incorrect로 식별되었고 교체되었다.

■ 모든 solutions을 GPT-3.5로 생성한 설정과 모든 solutions을 GPT-4로 생성한 설정 등 두 가지 추가 설정도 고려했다. 

■ Table 7을 보면, GPT-4를 이용한 correction이 성능을 올리지 못했음을 볼 수 있다. 이는 더 정확한 GPT-4 solution을 사용하면, 더 좋은 synthetic data로 이어져 student model이 더 높은 score를 달성할 수 있다는 직관에 반하는 결과이다. 

■ 이 결과에 대해 저자들은, GPT-3.5가 생성한 synthetic data로 학습하는 것은 본질적으로 GPT-3.5를 distill하는 과정이기 때문일 수 있다고 본다. 

■ 즉, 일부 sample의 answer correctness만 GPT-4 수준으로 올리는 것이, 전체 dataset의 style 및 reasoning distribution을 더 student-friendly하게 만들지는 않을 수 있다는 것이다.  

■ 일부 solution이 틀렸더라도, 오히려 그것들이 open-source LLM이 GPT-3.5의 distribution을 모방하는 데 도움이 될 수 있다고 본다. 

■ 그래서 저자들은 최종 MathScale pipeline에서 validation 및 correction step을 생략하기로 한다. 


5.4 Performance on a Fresh Math Dataset

■ MathScaleQA는 MWPBENCH test set과의 overlap을 막기 위해 엄격히 decontaminate되었지만, 일부 test set이 GPT-3.5-Turbo에 이미 노출되었거나 LLaMA-2의 training data에 포함되었을 가능성은 여전히 작게나마 존재할 수 있다. 

■ 저자들은 GPT-3.5-Turbo가 API를 통해 사용자가 제출한 human-annotated query를 사용할 수 있으며, 이런 query 안에 GSM8K 같은 test set이 포함될 수 있다고 지적한다. 

■ LLaMA-2의 training set은 공개되어 있지 않으며, MWPBENCH test set의 일부 example이 포함되었는지 확신할 수 없다. 

■ 이 문제를 해결하기 위해 저자들은 중국의 대입시험인 Gaokao의 최신 수학 시험에서 나온 30개 수학 문제로 구성된 새로운 dataset을 구축했다. 

■ 저자들은 이 dataset을 FreshGaokaoMath-2023라고 부르며, 이것이 LLaMA-2나 GPT-3.5-Turbo의 training data에 포함되었을 가능성은 낮다고 본다. 

■ Table 8을 보면, MathScale은 WizardMath와 MetaMath를 일관되게 능가했으며, 이는 Table 5의 main result와 일치한다. 이는 MathScale이 fresh math question을 처리하는 데 robust하고 adaptable함을 보여 준다.