Quant Trading Bot Devlog

Read in English

"[260920] AI 응답 온도 실험 - 판정은 애매, 최종 결정은 내일로"

이틀째 이어온 비교 실험 결과가 나왔지만 크기가 애매해 다른 AI에게 재검토를 맡겼고, 성능측정 도구에 밀려있던 수선들도 한번에 끝냈습니다.

온도 실험 본 비교가 끝났다

어제 시작한 AI 응답 무작위성(온도) 설정 비교 실험이 오늘 새벽 본 비교까지 마쳤습니다.

기존 설정과 바꾼 설정을 같은 입력으로 여러 번 돌려서, 결과가 실제로 달라지는지 통계적으로 판정하는 실험이었습니다.

그런데 첫 판독에서 판정 기준 중 두 가지가 딱 떨어지지 않는 "회색" 구간에 걸렸습니다. 비교 대상 런 하나는 품질 기준 자체를 통과하지 못해 무효 처리했습니다.

그래서 그 런만 다시 돌리는 대체 실행을 자동으로 걸어뒀고, 낮 동안 그 결과를 기다렸습니다.

방향은 뚜렷한데 크기가 애매했다

오후 늦게 대체 실행까지 모두 끝나서 최종 판독을 돌렸습니다.

바꾼 설정이 모델을 더 "보류" 쪽으로 밀어붙이는 경향 자체는 여러 검정 방식으로 다시 확인해도 뚜렷했습니다. 우연으로 보기는 어려운 수준이었습니다.

문제는 그 경향이 "문제 삼을 만큼 큰가"였습니다. 이 부분은 실험 데이터만으로는 폭넓게 걸쳐 있어서 단정하기 어려웠습니다.

애초에 이 설정을 바꾼 이유가 "반복했을 때 결과가 더 일관되게 나온다"는 것이었는데, 이번 실험에서는 그 이득이 전혀 확인되지 않았습니다. 바꿀 이유였던 근거 하나가 빠진 셈입니다.

다른 AI에게 두 차례 검토를 맡겼다

판정이 애매해서, 이번 실험과 무관한 다른 AI에게 원자료만 넘기고 독립적으로 다시 계산해보라고 맡겼습니다.

같은 결론이 나왔습니다. 방향은 확실하지만 크기는 이 데이터만으로 확정할 수 없다는 것이었습니다.

이어서 "그럼 내일 저녁까지 어느 쪽으로 결정하는 게 나은가"를 다시 물었습니다. 돌아온 추천은 예전 설정으로 되돌리고 당분간 고정해두자는 쪽이었습니다.

이미 도입한 설정을 계속 쓰려면 "이미 쓰고 있다"는 것 말고 새로운 근거가 필요한데, 그런 근거가 이번 실험에서 나오지 않았다는 이유였습니다.

최종 결정은 사람이 직접 내리기로 하고 내일 저녁까지 미뤄뒀습니다. 오늘 밤에는 판정 정밀도를 조금 더 높이기 위한 추가 실행 하나만 더 걸어뒀습니다.

성능측정 도구에 밀려있던 수선들도 처리했다

이것과 별개로, 최근에 만든 LLM 성능측정 도구 쪽에 처리하지 못하고 밀려있던 자잘한 수선 건들이 여럿 있었습니다.

오늘은 이걸 한 번에 몰아서 처리했습니다.

측정에 쓰는 보조 프로그램 하나를 다시 빌드하다가, 그 결과를 읽어들이는 로그 해석 규칙이 애초에 실제 출력 형식과 맞지 않아서 사실상 한 번도 제대로 작동한 적이 없었다는 걸 발견했습니다. 형식을 실제 출력에 맞춰 다시 고쳤습니다.

주말이나 휴장일에는 시간대 제한이 잘못 걸려서 매번 수동으로 우회해야 했던 문제도 원인을 찾아 고쳤습니다.

결과 보고서 파일이 이름 규칙에 걸려 정식 위치에 설치되지 못하고 임시 경로로만 남던 문제도, 임시방편 대신 근본적으로 고쳤습니다.

어제 결론 낸 "자동 재개는 당분간 쓰지 않고 사람이 대화로만 재개한다"는 방침도 오늘 다시 한 번 확인해서 그대로 유지하기로 했습니다.

이 수선들을 반영한 뒤 저녁에 관련 상주 서비스들을 전부 재시작해서 새 코드가 실제로 적용되도록 했습니다.

앞으로

내일 저녁까지 온도 설정을 어느 쪽으로 확정할지 결정하는 게 가장 먼저입니다.

오늘 밤 걸어둔 추가 실행 결과도 함께 확인할 예정입니다.

(이 결정이 실제로 어떻게 났는지는 21일 글(새 창)에 정리했습니다.)