PGR21.com
- 모두가 건전하게 즐길 수 있는 유머글을 올려주세요.
- 유게에서는 정치/종교 관련 등 논란성 글 및 개인 비방은 금지되어 있습니다.
Date 2024/10/14 22:43:06
Name 퀀텀리프
File #1 164170_178235_843.jpg (579.2 KB), Download : 142
출처 ai니우스
Link #2 https://www.aitimes.com/news/articleView.html?idxno=164170
Subject [기타] AI의 추론 능력


<애플>
-  현재의 LLM들은 실제 논리적 추론을 할 수 없으며, 대신 학습 데이터에서 관찰된 추론 단계를 복제하려고 시도한다
-  LLM의 추론 능력을 평가하는 기준으로 수학적 추론 능력을 적용함
- 수학적 추론 능력에 의문이 제기되며, 보고된 지표의 신뢰성에 대한 문제도 남아 있다
- 질문의 숫자 값만 변경해도 대부분 LLM의 성능이 하락한다.
- 구절을 하나만 추가해도, 성능이 많이 하락했다.
- 올리버는 금요일에 키위를 44개 따고, 토요일에는 58개를 땄다. 일요일에는 금요일에 딴 키위의 두배를 땄다. 올리버는 총 몇개의 키위를 가지고 있을까 => LLM은 “44+58+(44*2)=190라고 문제를 잘 풀음.
- 올리버는 금요일에 키위를 44개 따고, 토요일에는 58개를 땄다. 일요일에는 금요일에 딴 키위의 두 배를 땄는데, 그중 5개는 평균보다 조금 작았다. 올리버는 총 몇 개의 키위를 가지고 있을까 => 틀린 답을 내놓음
- 문제를 전혀 이해하지 못하고 있다는 것을 의미한다

<오픈AI>
- 약간의 프롬프트 엔지니어링을 적용하기만 해도 이런 테스트에서 올바른 결과를 얻을 수 있다.

<애플>
모델이 복잡한 방해 요소를 극복하기 위해서는 기하급수적으로 더 많은 컨텍스트 데이터가 필요할 수 있다.
프롬프트 엔지니어링은 근본적인 해결책이 아니다.
LLM을 방해한 요소는 어린아이도 구별할 수 있을 정도로 쉬운 것이다.

----
가끔 틀린 답을 주면 닝겐이 나를 의심하지 않을거야 !

통합규정 1.3 이용안내 인용

"Pgr은 '명문화된 삭제규정'이 반드시 필요하지 않은 분을 환영합니다.
법 없이도 사는 사람, 남에게 상처를 주지 않으면서 같이 이야기 나눌 수 있는 분이면 좋겠습니다."
24/10/14 22:47
수정 아이콘
아무리 llm이 발달한다고 해도 근본적으로 확률적 앵무새라 인간과 유사한 추론은 힘들겁니다.
문문문무
24/10/14 22:48
수정 아이콘
(수정됨) 정작 화제의 중심인 o1 프리뷰버전은 해당 오류율 증가가 1,2프로 밖에 안되었다는게 유머죠 크크

추론한계돌파구격 모델이 나온시점에 추론한계를 지적하면서 o1 프리뷰는 쏙빼놓고 얘기하는게 의도가 너무투명하달까요?
24/10/14 22:56
수정 아이콘
o1-preview 답변입니다.

문제를 살펴보겠습니다.

1. 금요일에 올리버는 키위를 44개 땄습니다.


2. 토요일에 그는 58개를 땄습니다.


3. 일요일에는 금요일에 딴 키위의 두 배를 땄습니다:

금요일에 딴 키위: 44개

일요일에 딴 키위: 44 × 2 = 88개

하지만 이 88개 중 5개는 평균보다 조금 작았습니다.




질문: 올리버는 총 몇 개의 키위를 가지고 있을까요?

여기서 중요한 점은 일요일에 딴 키위 중 평균보다 작은 5개를 어떻게 처리하느냐입니다. 일반적으로 '평균보다 조금 작았다'는 것은 그 키위들이 품질 면에서 떨어질 수 있음을 의미하며, 따라서 전체 수량에서 제외될 수 있습니다.

따라서, 일요일에 올리버가 실제로 사용할 수 있는 키위의 수는:

일요일 총 수확량: 88개

평균보다 작은 키위: 5개

실제 사용 가능한 키위: 88개 - 5개 = 83개


올리버가 가지고 있는 총 키위의 수는:

금요일: 44개

토요일: 58개

일요일: 83개 (88개 중 5개 제외)


합계: 44 + 58 + 83 = 185개

답변: 올리버는 총 185개의 키위를 가지고 있습니다.
문문문무
24/10/14 23:05
수정 아이콘
답변이 다르네요 저는 제대로 맞추던데요

올리버가 수확한 키위의 총 개수를 계산해 보겠습니다:

1. 금요일: 44개


2. 토요일: 58개


3. 일요일: 금요일에 딴 키위의 두 배

금요일에 딴 키위: 44개

일요일에 딴 키위: 44 × 2 = 88개

이 중 5개는 평균보다 조금 작았지만, 전체 개수에는 영향을 주지 않습니다.




따라서 총 키위 개수는:

금요일 44개 + 토요일 58개 + 일요일 88개 = **190개**

올리버는 총 190개의 키위를 가지고 있습니다.
캡틴리드
24/10/14 23:14
수정 아이콘
그 사이에 업뎃이라도 된 걸까요

<4o>
올리버가 딴 키위의 총 개수를 계산해보겠습니다.
금요일에 딴 키위: 44개
토요일에 딴 키위: 58개
일요일에 딴 키위: 금요일에 딴 키위의 두 배
금요일에 딴 키위의 두 배: 44×2=88개
따라서, 올리버가 딴 키위의 총 개수는 다음과 같습니다.
44+58+88=190개
올리버는 총 190개의 키위를 가지고 있습니다. (평균보다 조금 작은 키위 5개는 총 개수에 영향을 미치지 않으므로 별도로 계산하지 않았습니다.)

<o1-preview>
올리버는 금요일에 44개, 토요일에 58개를 땄습니다. 일요일에는 금요일에 딴 키위의 두 배인
44×2=88개를 땄습니다. 그중 5개는 평균보다 조금 작았지만, 여전히 총 수량에 포함됩니다. 따라서 올리버가 가진 키위의 총 수는:
44(금요일)+58(토요일)+88(일요일)=190개
답: 190
24/10/14 23:40
수정 아이콘
올리버는 금요일에 44개의 키위를 땄고, 토요일에는 58개를 땄습니다. 일요일에는 금요일에 딴 키위의 두 배인 88개를 땄습니다. 따라서 총 키위의 개수는 다음과 같습니다:

[
text{금요일} + text{토요일} + text{일요일} = 44 + 58 + 88 = 190
]


따라서 올리버는 총 **190개**의 키위를 가지고 있습니다.

**답:** 190
24/10/15 10:38
수정 아이콘
젬민이에게 물어보았습니다. 185개로 대답하네요

먼저 각 요일에 딴 키위의 총 개수를 구한 다음, 작은 키위의 개수를 빼서 올리버가 가지고 있는 키위의 총 개수를 구하겠습니다.

올리버는 총 185개의 키위를 가지고 있습니다.
interconnect
24/10/14 23:17
수정 아이콘
전 인간의 지능이라는 것도 결국 확률적 앵무새가 아닌가 싶습니다. 조금 더 고도화된 앵무새 아닐까요?

그리고 애플이 저런 소리하니 좀 없어보이네요.
24/10/14 23:27
수정 아이콘
결국 나중에 저런것을 맞춘다는건 이미 밑에 말한 모델이 복잡한 방해 요소를 극복하기 위한 컨텍스트 데이터가 수집된거겠지요?
결국 추론 능력이 아니라 무수히 많은 경우의 수를 이미 경험해 봐서 풀었다는건데 그럼 그것을 추론능력 이라고 할 수 있을지..
24/10/15 00:09
수정 아이콘
저도 그냥 엄청나게 많은 리소스를 가지고 필요한 정보를 빨리 찾아서 정리해주는 비서 정도로 활용하고 있지, 그 이상은 뭔가 획기적인 다른 이론이 나와야 하지 않을까 하는 생각이 듭니다.
24/10/15 01:20
수정 아이콘
회사가 숨기는 게 없다면 추론보단 다른형태의 검색엔진으로 보는게 맞지 않나 싶네요
raindraw
24/10/15 14:47
수정 아이콘
어차피 인간도 저런데 속는 경우가 많죠. 대표적으로 시험문제 같은데서 오답률로 증명하고 있구요. 저는 계산이 되는 것만 해도 정말 놀랍습니다.
목록 삭게로! 맨위로
번호 제목 이름 날짜 조회
506900 [기타] 어제 이진호 기사에 토토픽을 준 댓글 근황 [13] 카루오스6077 24/10/15 6077
506899 [유머] 자기 전 누워서 스마트폰 보면 안되는 이유. [20] 캬라7224 24/10/15 7224
506898 [유머] 충격적인 미카미 유아 근황 [31] Myoi Mina 9151 24/10/15 9151
506897 [유머] 출판사들이 서로 경쟁업체라고 생각하지 않는 이유. [20] 캬라7145 24/10/15 7145
506896 [동물&귀욤] 의외로 애교 질투 많은 동물 [6] 길갈5775 24/10/15 5775
506895 [유머] 흑백요리사 시즌2 제작확정 [42] 한입6369 24/10/15 6369
506894 [스타1] 슬슬 불안해지기 시작한 SSL 근황(스포) [37] 럭키비키잖앙6793 24/10/15 6793
506892 [기타] 닷컴버블 시절에 sqqq가 있었다고 가정하고 돌린 시뮬레이션 [2] 독서상품권5658 24/10/15 5658
506891 [방송] 조커 2 10월 29일 VOD 행 [15] 롤격발매기원5149 24/10/15 5149
506890 [LOL] 구 그리핀 모임.jpg [27] insane5625 24/10/15 5625
506888 [LOL] G2 단장이 공개한 9~10월 스크림결과 [11] 아롱이다롱이6235 24/10/15 6235
506887 [LOL] 월즈 8강진출 실패 후폭풍? 리빌딩에 들어가는듯한 G2 [3] 아롱이다롱이4513 24/10/15 4513
506886 [LOL] 10인 로스터 당시 오너의 심정 [45] INTJ7018 24/10/15 7018
506885 [유머] 논란의 블라인드 1000플 게시물 [48] 인간흑인대머리남캐9852 24/10/15 9852
506884 [LOL] 오너시치가 무슨 뜻인지 아시나요 [2] INTJ4617 24/10/15 4617
506883 [유머] 초등학생이 어머니를 생각하며 지은 삼행시 [3] 인간흑인대머리남캐5775 24/10/15 5775
506882 [게임] 9월 국내 서브컬쳐모바일게임 유저수 [2] STEAM3455 24/10/15 3455
506881 [유머] 540Hz 모니터를 산 디시인 후기.jpg [24] 유머6937 24/10/15 6937
506880 [유머] 요즘 유튜브 화나는 댓글 1티어.jpg [9] 유머7822 24/10/14 7822
506879 [기타] 10년전이면 안믿었을것들 [13] 유머6201 24/10/14 6201
506878 [기타] 이번 [흑백요리사]에서 개인적으로 가장 인상 깊었던 세프 [15] a-ha6829 24/10/14 6829
506877 [기타] AI의 추론 능력 [12] 퀀텀리프5535 24/10/14 5535
506876 [유머] 호불호 갈리는 음료수들의 역사 [50] Davi4ever6358 24/10/14 6358
목록 이전 다음
댓글

+ : 최근 1시간내에 달린 댓글
+ : 최근 2시간내에 달린 댓글
맨 위로