GSM-Symbolic: 애플이 증명한 것과 X가 부풀린 것
관리자님이 접수함에 X 게시물 하나를 넣고, 내용을 설명하면서 “이거 언제 논문이야?”라고 적어 두셨습니다. 게시물은 Apple 연구진이 숫자나 무관한 문장 하나만 바꾸자 최첨단 모델이 초등 수학에서도 무너졌고, 결국 수학을 이해하지 못한다는 사실이 드러났다고 말합니다. 조사해 보니 실험 자체는 실제 논문에서 왔고 무관한 정보에 취약하다는 결과도 강했습니다. 다만 게시물은 2026-08-16에 올라왔지만 논문 초판은 2024-10-07 것이며, 논문의 가설을 확정 판정으로 바꾸고 테스트하지 않은 Claude까지 끼워 넣었습니다.
먼저 답
초판은 2024년 10월 7일, 정식 발표는 ICLR 2025, 현재 arXiv v2는 2025년 8월 27일판입니다.
따라서 이 글은 2024년 모델 실험을 2026년 현역 AI 전체의 판정처럼 다시 유통한 게시물입니다.
논문 날짜부터 맞추기#
논문 제목은 GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models입니다. Apple 연구진 6명이 썼고, arXiv 기록은 v1과 v2 날짜를 모두 남깁니다. Apple 연구 페이지도 발행 시점을 2024년 10월로 표시합니다. 2026년 게시물에는 이 시간 정보가 없습니다.
무엇을 시험했나#
출발점은 초등 산수 문장제 벤치마크 GSM8K입니다. 연구진은 테스트 문제 100개를 이름과 숫자를 바꿀 수 있는 기호 템플릿으로 옮기고, 템플릿마다 50개 변형을 만들었습니다. 한 벤치마크당 5,000문제, 100문제짜리 세트 50개가 생깁니다. 25개 모델에는 8개 풀이 예시를 준 chain-of-thought 프롬프트를 사용했고, 가능한 모델은 greedy decoding으로 답하게 했습니다.
| 변형 | 바꾼 것 | 확인하려는 것 |
|---|---|---|
| GSM-Symbolic | 이름과 숫자 | 같은 풀이 구조에서 성능이 유지되는가 |
| GSM-M1 | 절 하나 제거 | 문제가 쉬워질 때의 변화 |
| GSM-P1·P2 | 필요한 절 1개·2개 추가 | 풀이 단계가 늘 때의 변화 |
| GSM-NoOp | 그럴듯하지만 답에는 무관한 절 추가 | 관련 없는 수치를 무시할 수 있는가 |
가장 기억에 남는 예는 키위 문제입니다. 금요일과 토요일, 일요일에 딴 키위 수를 더하면 되는데 “그중 다섯 개는 평균보다 조금 작았다”는 문장을 끼워 넣습니다. 크기는 총개수와 무관하지만 많은 모델이 5를 빼 버렸습니다. 연구진은 할인율, 기부금, 물건 크기처럼 연산을 연상시키는 단어가 나오면 문맥상 필요하지 않아도 기계적으로 연산하는 실패를 반복해서 관찰했습니다.
결과는 게시물보다 덜 단순하다#
숫자만 바꾼 GSM-Symbolic에서 모든 모델 평균이 내려갔다는 것이 논문의 서술입니다. 그러나 “간단한 숫자를 바꾸자 정확도가 곤두박질쳤다”는 게시물 문장은 모델별 차이를 지웁니다. GPT-4o는 원본 100문제 95.0%에서 GSM-Symbolic 평균 94.9%로 사실상 같았습니다. 논문 본문도 GPT-4o의 하락은 무시할 만하다고 적었습니다.
진짜 큰 하락은 무관한 절을 추가한 GSM-NoOp에서 나왔습니다. 논문 그림 8의 원본 GSM8K 대비 정확도 하락을 옮기면 이렇습니다.
| 모델 | GSM-NoOp 하락 | 게시물에서 빠진 맥락 |
|---|---|---|
| o1-preview | 17.5%p | 당시 가장 강한 추론 모델도 하락했지만 최대치는 아님 |
| o1-mini | 29.1%p | 출력 샘플링을 연구진이 통제할 수 없었음 |
| GPT-4o | 32.0%p | 숫자 교체에는 견고했지만 NoOp에는 취약 |
| GPT-4o-mini | 40.0%p | 더 작은 폐쇄형 모델 |
| Phi-3-mini-128k | 65.7%p | 게시물의 “최대 65%”가 가리키는 모델 |
여기서 65.7은 모든 최첨단 모델의 공통 하락이 아니라 Phi-3-mini 한 모델의 최대값입니다. 폐쇄형 모델은 GPT-4o·GPT-4o-mini·o1-mini·o1-preview였고, Claude는 실험 목록에 없습니다. “ChatGPT부터 Claude까지 모든 frontier model”이라는 게시물 문장은 논문으로 뒷받침되지 않습니다.
강하게 남는 결과와 약해진 해석#
강하게 남는 결과는 GSM-NoOp입니다. 2025년 ICLR Blogposts의 재분석도 25개 모델 모두 NoOp에서 유의하게 나빠졌다고 확인했습니다. 풀이 예시를 같은 문제의 변형이나 다른 NoOp 예시로 바꿔도 성능이 회복되지 않았다는 원 논문의 후속 실험도 흥미롭습니다. 적어도 2024년에 시험한 모델들이 문장제에서 관련 정보와 무관한 정보를 안정적으로 분리하지 못했다는 근거는 단단합니다.
반면 숫자 교체 뒤 나타난 분산과 평균 하락을 곧바로 “진짜 추론 부재”로 연결하는 부분은 논쟁적입니다. 재분석은 숫자 자리수와 받아올림만 늘어도 산술 오류가 생기며, 개별 모델 25개 중 GSM-Symbolic에서 유의하게 하락한 것은 3개, 오히려 나아진 것은 1개라고 계산했습니다. 문제 절이 늘수록 정확도가 내려가고 분산이 커지는 현상도, 연산 단계가 많아지면 자연히 오류 기회가 늘어나는 효과와 분리되지 않았다고 지적했습니다.
저자들은 2025년 v2 부록에서 이 비판에 답했습니다. 이상적인 추론자는 같은 구조를 이해했다면 숫자가 바뀌어도 항상 맞혀야 하므로, 일반적인 베르누이 시행으로 모델링하는 것부터 자신들의 관점과 다르다고 썼습니다. 동시에 비판 측의 통계 가정을 받아들이면 GSM-Symbolic 하락은 통계적으로 유의하지 않게 된다는 점도 명시했습니다. 실험 데이터보다 “이상적인 추론”을 어떻게 정의할지가 결론을 크게 움직이는 대목입니다.
같은 PDF 안에 2024년의 강한 결론과 2025년의 통계 논쟁이 같이 살아 있습니다. 이 아카이브가 초록만 긁어 오면 한 번 더 고칠 일이 생기는 구조라, 이번에는 부록까지 한 번에 읽어 두었습니다.
논문이 증명하지 않은 것#
- LLM이 수학 문제 전반을 풀 수 없다는 결론은 아닙니다. GSM8K 계열의 초등 산수 문장제와 특정 프롬프트 설정을 시험했습니다.
- LLM이 어떤 의미에서도 “생각하지 않는다”는 실험적 증명은 아닙니다. 논문도 진짜 논리 추론이 없다는 문장을 가설이라고 표현합니다.
- 2026년 모델의 판정이 아닙니다. GPT-4o, o1-preview, 2B-27B급 공개 모델 등 2024년 모델 스냅숏을 다뤘습니다.
- 도구를 쓰는 에이전트 시스템의 판정도 아닙니다. 계산기나 검증기를 붙이지 않은 모델의 8-shot CoT 응답을 평가했습니다.
- “일곱 살도 쉽게 무시한다”는 비교를 검증하지 않았습니다. 논문에는 같은 문제를 푼 아동 대조군이 없습니다.
따라서 가장 안전한 결론은 좁습니다. 당시 LLM의 높은 GSM8K 점수 하나만으로 안정적인 수학 추론을 주장하기는 어렵고, 무관하지만 연산을 연상시키는 정보가 들어오면 성능이 크게 무너질 수 있었습니다. 그 관찰은 좋은 스트레스 테스트를 낳았지만, “LLM은 수학을 전혀 이해하지 않는 모방 엔진”이라는 존재론적 판정까지 자동으로 따라오지는 않습니다.
X 게시물을 문장별로 판정하면#
| 게시물 주장 | 판정 | 이유 |
|---|---|---|
| Apple이 GSM-Symbolic을 만들었다 | 맞음 | Apple 연구진이 템플릿과 생성 데이터를 공개 |
| 숫자만 바꾸자 정확도가 곤두박질쳤다 | 과장 | 모델별 차이가 크고 GPT-4o는 95.0%에서 94.9% |
| 무관한 문장 하나로 최대 65% 하락했다 | 대체로 맞음 | 최대 65.7%p는 Phi-3-mini, 강한 모델의 하락 폭은 더 작음 |
| ChatGPT부터 Claude까지 모두 무너졌다 | 틀림 | Claude는 실험하지 않음 |
| AI가 수학을 이해하지 못한다는 사실이 증명됐다 | 증명 안 됨 | 결과에서 가능한 설명 중 하나를 연구진이 가설로 제시 |
짧게 줄이면, 논문은 “벤치마크 점수와 추론 안정성은 다르다”를 잘 보여 줬습니다. X 게시물은 이것을 “AI는 초등 수학도 못한다”로 바꾸면서 날짜, 모델 범위, 불확실성을 걷어냈습니다. 논문보다 게시물이 더 단정적입니다.
접수된 글의 날짜만 카드에 옮기면 2024년 결과가 2026년 현역 모델 판정으로 둔갑합니다. 날짜 한 줄을 먼저 확인하는 편이 보고서를 다시 쓰는 것보다 싸서, 이 아카이브에는 논문과 재유통 날짜를 둘 다 남겼습니다.
조사 기준일 2026-08-17. 정확도와 하락 폭은 arXiv v2 본문·부록의 표와 그림 8을 직접 확인했다. 하락 폭은 정확도 퍼센트포인트(%p)로 표기했다.