에이전트코리아 · 2026-09-17
JEV/System One의 ENUM 판정 모델을 QC·RAG·대화 분류에 적용해 본 경험, Gemini·Claude·Codex·Astra의 환각·성능·구독 논의, 에이전트 친화적 웹과 멀티에이전트 검수 방식을 정리했습니다.
오늘의 대화
JEV/System One이라는 ENUM 방식의 판정 모델이 빠른 분류와 QC 레이어에 쓸 수 있는지, RAG·에이전트 라우팅에 어떻게 연결할지를 두고 가장 긴 기술 대화가 이어졌다. 동시에 Gemini 3.8의 용도별 성능과 환각, Gemini 4로 추정되는 모델의 벤치마크 전언, Claude·Codex·Astra의 리셋·구독·성능 체감이 반복해서 나왔다. 오후와 밤에는 Aside를 계기로 에이전트가 읽기 쉬운 웹을 설계하는 방법, Hermes·Orca·OpenCode를 조합한 멀티에이전트 하네스, AI 결과를 사람이 검증해야 하는 이유가 구체적인 경험과 함께 논의됐다.
원문 인용의 화자명은 공개 범위에 맞게 역할·회사 식별 정보가 필요한 경우 줄였으며, 자동 SNS·방 요약, 열람 코드·초대 링크, 사진과 개인 결제·회사·위치 정보는 공개 문서에서 생략했다.
이야기 나온 주제
Gemini 3.8·Claude·Codex·Astra의 환각과 용도별 선택
참여자들은 네거티브리스트나 금지 규칙만 강조하면 모델이 금지 항목에 집착해 목표에서 벗어날 수 있다고 경험했다. Gemini 3.8은 일반적인 질문과 이미 정해진 간단한 자동화에는 빠르고 쓸 만하다는 평가가 있었지만, 복잡한 코딩이나 넓은 범위의 자동화에는 Astra급 추론을 기대하기 어렵다는 의견도 나왔다. 반대로 검색·아부성 환각이 심해 법률·세금처럼 판단이 중요한 일에는 주의해야 한다는 지적이 있었고, 상위 목표·단서·예시를 충분히 주는 프롬프트가 경량 모델의 한계를 줄이는 방법으로 제안됐다.
원본 대화 · 관련 메시지 발췌 · 10:37–10:49, 10:57
10:37 · 최은우/연구원 강화학습의 폐해이려나요
10:37 · Sophie AI들한테 네거티브리스트를 주거나 금지를 주면 그걸 안틀리는데 너무 집착하느라 자꾸 길을 잃더라고요
10:38 · Sophie 사람이랑 비슷한 거 같아요 - 그래서 상위 목표를 잘 설계하고 거기 잘 닿는 경로 몇 가지 예시를 들고 맡기는게 - 좋은 모델들한텐 마이크로매니징보다 더 좋은 것 같았어요
10:42 · 도깨비야 요즘은 성능 좋아졌나요? 3.2일때 잠깐 써보고 안써봤는데
10:43 · twojay 3.8은 괜찮습니다.
10:43 · twojay 일반인이 쓰기에 좋아요
10:44 · twojay 막 자동화… 넓은 스코프…. 코딩….. 그런 거에는 영…
10:46 · Sophie 제미니는… 다른것보다 환각이 너무…. 심해요. 클로드도 웹서치가 좀 떨어지고 코덱스는 웹서치 잘하는데, 제미니 환각이 제일 심한 것 같아서 복잡하고 중요한 작업 이런거보다. 환각이 심하면 일상작업에 더 안좋았던 거 같애서요 3.8은 좀 괜찮아졌나보네요
10:48 · twojay 단서나 해결할 방법을 쥐어주면 그걸 잘하면 되니깐요
10:48 · 자동화공장장 제미나이는 이미 거의 정해진 일을 빠르게 쭉 처리해야할 때 제일 잘하는 것 같아요
10:49 · twojay 3.8은 딱 그정도 모델입니다. ㅎㅎㅎ Flash 라서 사실 astra 급 성능을 바라면 안되기도 함 ㅎㅎ
10:57 · Sophie 사실 이래서 일반인들한테 잘 안권하거든요…. 저런걸 고려하고 쓸 수 있질 않고 그냥 단타 질문을 할 텐데 환각은 심해서요. 코딩이 문제가 아니라 일반인들이 사실 본인 법률, 세금, 정보확인 이런거 많이 물어보는데 제미니 물어본다고 생각하면 아찔 (물론 법무나 세무를 지피티에 물어보는 것도 문제가 많이 있을 수 있지만 그나마)
JEV/System One ENUM 판정 모델의 QC·RAG 활용
System One 계열의 JEV를 두고, 자유롭게 다음 토큰을 생성하는 일반 LLM이라기보다 미리 정한 선택지 중 하나를 빠르게 고르는 판정 모델에 가깝다는 설명이 나왔다. 참여자들은 분류·태스크별 QC·의도 라우팅처럼 결과 범위가 명확한 작업에는 유망하다고 봤고, 브라우저 사용 전후의 필터링이나 에이전트 파이프라인의 비용·입력량을 줄일 가능성도 이야기했다. 반면 서술형 보완이나 복잡한 전처리, 전문 도메인·한국어에서는 엣지 케이스와 맥락 민감도가 커서 기존 LLM의 QC와 베이스라인 비교가 필요하다는 반론이 이어졌다. 관련 소개 자료와 구현 저장소도 공유됐다: System One·JEV 소개, jev-judgment 저장소.
원본 대화 · 관련 메시지 발췌 · 14:29–15:26
14:29 · twojay 선지 결정필요한 곳에서는 정확도만 맥락적으로 좋다면
14:29 · twojay 자주자주 써먹을 거 같음
14:30 · twojay 미리 정해둔 값 안에서만 결과가 도출되는 것?
14:32 · 강정석 classification 이나
14:32 · 강정석 QC per Task 로 잡기 좋을 것 같아요
14:32 · 강정석 RAG 쪽 전처리 라우팅 보다는 이쪽이 더 맞아보인다는 느낌
14:33 · 강정석 프로덕션 서비스에서는 QC 레이어가 필수이다 보니까
14:38 · 강정석 써보고 QC 는 해야한다. 다만 이런 접근 자체는 혁신이라 불릴만은 하다
14:40 · 코난쌤 llm이 가지고 있는 next token prediction이 아니라
14:40 · 코난쌤 그냥 미리 뽑아놓고 골라골라 하는거라서
14:44 · 강정석 이건 범위를 1씩 10개를 잡고 각각에 1~10으로 평가하라고 해야함요
14:44 · 강정석 각각의 기준 노출 검사로는 괜찮은데
14:44 · 강정석 좀 더 넓거나 연쇄 검사에서는 보완이 필요한
15:09 · 강정석 브라우저 use에서 토큰 엄청 아끼겠네요?
15:10 · 자동화공장장 근데 브라우저 use쓰면 심하게 토큰 닳던데 백그라운드로 개발자모드로 스크립트 써라 하면 엄청 아끼던뎅
15:23 · 강정석 jev 는 저희 파이프라인에 공식으로 들어가긴 하겠네요
15:23 · 강정석 일단 Agentic QC 포함해서 전체 비용이 **% 감소되어버림…..
15:25 · 김씨 저흰 이거 참고해서 행동 인격체? 그런걸 시도해 보고 있어요
15:25 · 김씨 캐릭터가 255개의 행동들을 결정해서 사용하는
15:26 · 강정석 ENUM이 있다면 최고 옵션이죠
원본 대화 · 관련 메시지 발췌 · 20:42–20:56
20:42 · Tofukyung 위에 톡방 요약에 나온 Jev로, 각 카톡 +-5개 문맥까지 읽게 해서 ‘각 톡이 AI 관련인가?‘를 확률적으로 분류한 표입니다.
20:42 · Tofukyung 첫 확률 숫자 - +-5개 + Jev
20:42 · Tofukyung 두 번째 확률 숫자 - 그냥 단순히 각 대화를 Jev로 분류했을 때
20:43 · Tofukyung 그래서, Jev를 쓰면 빠르게 맥락에 대해 확률로 분류가 가능한 대신, 어떻게 잘 써먹느냐가 또 달라지는거 같아요
20:45 · 코난쌤 오픈클로 세션(클코, 코덱스, gjc, agy 등등) 라우팅을 jev로 시켜보고 있습니다
20:46 · 코난쌤 top-k 대신에 jev 쓰면 엄청 빠릿한 RAG이 만들어지겠군요
20:46 · Tofukyung 분류 실패 케이스 모아서 기존 llm돌리고, 그 피드백 모아서 jev 발전시키면 꽤 쓸만해질거 같아요
20:48 · 강정석 쿼리 의도 파악기는 괜찮을지도 몰라도
20:48 · 강정석 전처리에는 케이스가 너무 다양하고 엣지 커버가 안되은게 있어서
20:48 · 강정석 차라리 리랭커를 대체하고
20:48 · 강정석 넣는게 낫지 않나
20:48 · 코난쌤 쿼리 의도 파악도 잘 못합니다.
20:49 · 강정석 영어는 그나마 낫더라구요
20:49 · 강정석 한국어는 단순 감정 분석이나 사실 관계 파악에만 좀 있고
20:49 · 강정석 의학이나 전문 도메인에서 멀티 사고는 안되고
20:50 · 강정석 인풋 프롬프트에 따라서
20:50 · 강정석 확률 달라져요 저거
20:52 · Tofukyung 누가 봐도 AI 주제 대화들인데 +-5개 읽고도, 아예 기존 지식에 없는 키워드들은 다 AI아니라고 처리된게 보임
20:53 · Tofukyung 이해한 바로는 정규식과 llm 사이인데 좀 더 정규식쪽에 가까운 거 같은 체감인데
20:53 · 강정석 QC Layer 비용은 많이 줄어듭니다
20:54 · 강정석 빠르다 = 추론 별로 없다 = 맥락이 전부 = 맥락에 따라 답 다름
20:55 · twojay 약간 템플릿 프롬프트를 잘 짜야겠군요
20:55 · 강정석 여기에 또 RAG 주입!
Gemini 4 추정 모델과 모델 경쟁 전언
LMArena에 Gemini 4 Pro로 추정되는 모델이 등장했다는 전언이 공유되면서 출력 토큰 256K와 2M 컨텍스트 창, 가격 대비 성능에 대한 기대가 번졌다. 일부는 벤치마크상 Fable이 밀릴 수 있다고 평가하고 구독 이동을 말했지만, 다른 참여자는 출시 전 설레발이라며 실제 공개 전에는 믿지 않겠다고 했다. 이 주제의 모델명·컨텍스트·성능·출시 시점은 원문에서 검증되지 않은 추정으로 남긴다.
원본 대화 · 관련 메시지 발췌 · 14:49–15:08, 16:00, 22:24
14:49 · twojay LMArena에 gemini 4 pro로 추측되는 모델 발견
14:49 · twojay - 출력토큰이 256K
14:58 · 강정석 2M Context Window
14:59 · 강정석 벤치상으로 이제 페이블은 범부가 되었군요
15:00 · 인사하는 프렌즈 젬미니 가격도 싸고
15:00 · 인사하는 프렌즈 저대로만 나오면 ㄷㄷ
15:07 · twojay 이제 Arena에 뜬게 맞다면
15:07 · twojay 한 2-3주…?
15:08 · 자동화공장장 제미나이에게 작업 80%넘겼는데 이제 클로드 완전히 버려도 될 듯
16:00 · Dominic 나오기전엔 안믿는다!
22:24 · 헤헤헤 뭐지 잼미니4 나왔어요??
Codex·Claude·Astra 리셋·구독과 API 오류
리셋일과 초기화권을 기다리며 남은 사용량을 어떻게 쓸지 고민하는 흐름이 반복됐고, Codex·Claude·Astra·Gemini를 함께 구독하거나 작업별로 섞어 쓰는 경험이 공유됐다. Codex 앱에서 프롬프트 전송 버튼이 비활성화되는 문제, Gemini API 503 오류, 모델의 리셋·초기화 시점에 대한 불확실성도 나왔다. 정확한 계정 상태와 구독 비용·한도는 공개하지 않고, 이 source의 계정별 경험과 질문으로만 기록한다.
원본 대화 · 관련 메시지 발췌 · 11:05–11:07, 13:18–14:16, 16:08–16:48, 22:55
11:05 · HiDDeN 19일 리셋인데
11:05 · HiDDeN 어차피 2일이면 다쓰는데 19일까지 기다렸다가 한번에 돌릴까;;
11:07 · Ai시안 내일 저녁 리셋이죠!
13:18 · 아키Archi 전 기간도 많이 남았는데 토큰이 얼마 안남았어요 ㅠㅠ
13:23 · ㅈㅎ 저 궁금한게 있는데요.. codex 앱에서 작업을 뭘 하려고 하면 프롬프트 전송 버튼이 비활성화가 됩니다. 이게 대화창마다 차이가 있는데.. 혹시 이유를 아시나요?
13:57 · 춘식 흠 아직 안해준거보면 이번주 codex 리셋 없겠죠??
14:00 · 춘식 바로 리셋 버튼 누르러 가야지..
14:12 · 바보왕 배뽕 지피티 아스트라+루나
14:12 · 바보왕 배뽕 섞어쓰는중이요
14:16 · 춘식 전 codex x20, claude x5, gemini pro씁니당
16:08 · 헤헤헤 유니온 알파 일주일 무료래요
16:48 · 2255 아 제미니 api 503 나오는거 저만 그래요..??
22:55 · 한숨 쉬는 죠르디 아 리셋소식은 안들리네요
22:55 · 한숨 쉬는 죠르디 초기화권 써야하나?
Mac M1·M4와 AI 작업 환경
맥북 교체 비용과 M1·M4의 체감 차이가 짧게 논의됐다. 문서·일반 작업에는 M1도 충분하다는 경험이 있었고, 코딩이나 영상 작업에서는 세대 차이가 더 드러날 수 있다는 반응이 나왔다. 이 대화에서는 특정 작업의 벤치마크나 구매 결론까지 이어지지는 않았다.
원본 대화 · 관련 메시지 발췌 · 12:29–13:06
12:29 · 축하하는 라이언 얼마가 될까요 다음 맥북은 ㅠㅠ
12:48 · 아키Archi 저에게 맥북이란 m1이면 차고 넘치죠..
12:55 · 화성갈끄니까 아직도 현역이라니
12:55 · 화성갈끄니까 대단하긴하네요 M1
12:58 · AlexAI 저도 M1 + M4 두개인데 짱짱합니다 M1
13:02 · 축하하는 라이언 m1이랑 m4차이가 많이 없나봐요!?
13:02 · Dominic 그건 아닙니둥
13:06 · Penda Jr. 코딩하거나 비디오 작업하면….
Aside와 에이전트 친화적 웹 설계
Aside를 사용한 뒤 웹페이지가 에이전트에게 읽기 쉬운 구조인지 더 신경 쓰게 됐다는 경험에서, DOM의 alt 힌트·시맨틱 태그·SEO·UI 매뉴얼의 역할이 논의됐다. 단순히 화면을 동작시키는 힌팅과 페이지가 무엇을 의미하는지 이해시키는 문서화는 다르다는 문제의식이 있었지만, 현행 웹에서는 의미보다 서비스 동작이 우선되는 경우가 많다는 아쉬움도 나왔다.
원본 대화 · 관련 메시지 발췌 · 13:09–13:17
13:09 · twojay 어사이드 쓴 이후로
13:09 · twojay 웹페이지를 Agent가 잘 읽을 수 있도록 readable 하게 만들어야겠다는 생각이 드네용.
13:09 · twojay 팁이 있나용
13:09 · Dominic 에이전트 접근성 ㄷㄷ
13:09 · twojay 일단 DOM에 alt 같은 것에 힌트 우겨박아 넣는거…?
13:10 · Penda Jr. 요즘은 그냥 seo 적합하게 구성하라고 하면 되실겁니다
13:16 · Penda Jr. ‘문서’가 제공되던 하이퍼텍스트 기반 서비스에서
13:16 · Penda Jr. ‘서비스’가 제공되는 시절이 되버려서…
13:17 · twojay 사실 UI를 잘 쓰기 위한 매뉴얼과 힌팅만 잘되면 될거라는 생각이 잇어서
13:17 · twojay 시멘틱 태그도 고려대상이긴했는데
13:17 · twojay 결국 UI를 위한 힌팅이지 뭐하는 곳인지 이해시키기 위한 힌팅이 아닝께
Hermes·Orca·OpenCode와 멀티에이전트 하네스
Claude를 Hermes로 연결할 수 있는지와 여러 계정을 어떻게 다루는지 묻는 과정에서, Hermes는 Claude Code·Codex·OpenClaw처럼 에이전트를 실행하는 쪽이고 Orca는 그 에이전트들을 돌리기 편하게 해주는 환경이라는 구분이 제시됐다. 비교 대상으로 Herdr·Comet·Aside가 언급됐고, OpenCode에 Uroboros의 루프 스킬을 붙인 작업 경험도 공유됐다. 매장 영상 업로드 자동화와 멀티에이전트 출력 형식 맞추기처럼 실제 적용 사례가 나왔지만, 반복 작업이 원하는 형태로 수렴할 때까지 하네스를 계속 다듬어야 한다는 부담도 함께 드러났다.
원본 대화 · 관련 메시지 발췌 · 18:04–18:17, 19:10–20:00, 20:34–20:36
18:04 · 2255 헤르메스로 클로드 연결해서 쓰는분 계세여?!
18:05 · 2255 맥스 요금제는 된다는거 같더라구요?
18:06 · 2255 헤르메스 말고 대안이 오픈클로 정도 있나요??
18:08 · Tofukyung 클로드는 channels로 연결해 쓰시면 편하고 좋습니당(헤르메스랑 같이 쓰려면 더더욱)
18:10 · 고인 헤르메스랑 오르카랑 비교하면 뭐가 다를까요??? 둘다써봤는데 헤르메스가 스스로 학습한다고 해서 뭔가 달라지는 걸 모르겠던 것 같은데…
18:13 · 콜라 에르메스는 클로드코드나 코덱스, 오픈클로랑 비교해보는게 좋아보이구.. 오르카는 앞에 에이전트들을 돌리기 편하게 해주는 환경이랄까용
18:15 · 줄리엣 [비교]
18:15 · 줄리엣 - hermes vs openclaw
18:15 · 줄리엣 - claude vs chatgpt
18:15 · 줄리엣 - orca vs herdr
18:15 · 줄리엣 - comet vs aside
19:10 · Rlslam 저 오늘 부터 opencode에 우로보로스 깔아서 작업 시키는데 이거 생각보다 많이 맛돌이네요
19:19 · 코난쌤 loop 닫는 스킬 만들어두셨으니 한번 사용해보세요
19:36 · 바보왕 배뽕 요즘은 코덱스로 매장영상 업로드 자동화중이에요
19:59 · 뀨 멀티에이전트는 런칭이 시작인 게임이군요………하루종일 다듬고 있네요
20:00 · 뀨 똑같은 일을 제가 원하는 아웃풋 형태로 나오게 하는게 쉽지가 않네요 ㅋㅋㅋㅋ
20:34 · 뀨 지금 보니까 제꺼는 딱 l3-l5언저리가 섞여서 그사이 어딘가까지만 구현이 되어있는 상태네요
20:36 · 뀨 요건 소프트웨어 빌드 테스트 뭐 이런게 포함되어있어서 제가 바로쓸순 없긴한데 전 원문대조 출처 수치 이런거로 좀 응용해서 써보고 결과알려드리겠습니다
AI 도입에서 인간 검수와 비판적 사고
바이브 코딩과 업무 자동화는 AI에게 맡기는 행위 자체보다 답변을 읽고, 오류 원인과 보안 경계를 확인하고, 테스트로 결과를 검증하는 과정이 핵심이라는 경험이 공유됐다. AI가 만든 목차·보고서를 검증하지 않고 가져오는 태도에 대한 답답함, 사람은 아이디어와 판단 기준을 제시하고 AI는 구현을 맡아야 한다는 관점, 왜 되는가·왜 안 되는가를 반복 확인하는 개발 루프가 한 흐름으로 이어졌다. 마지막에는 Astra가 단정적이고 Fable이 나이브하게 느껴진다는 비교도 나왔지만, 특정 모델을 일반적인 우위로 결론내리지는 않았다.
원본 대화 · 관련 메시지 발췌 · 20:57–21:35
20:57 · 뀨 선생님들은 다 프로그래머세요 ‘ㅁ’? 전 그쪽에 전혀 바탕이없어서그런지 ai 발전속도를 따라가기가힘드네요 ㅋㅋ 제가 쓸만큼만 따라가는거도 벅찬
21:09 · 축하하는 춘식이 바이브코딩은 시행착오를 겪으면서 AI답변도 정독하고 에러가 왜 나는지 보안경계는 어디인지 등등 계속 공부하고 고민하면서 실력이 늘어나는거라 생각하는데 AI답은 정독도 안하고 안되면 안된다고 해줘만 반복하고 잇으니 답답..
21:09 · 강정석 근데 전 AI 답을 믿지 않아요
21:09 · 강정석 테스트 결과만을 믿죠
21:10 · 강정석 뭐든 아이디어는 사람 제시고
21:10 · 강정석 그걸 AI가 구현해야지
21:11 · 강정석 A → 왜 돼? 왜 안돼? 뭐가 예상 가능한 스케일 에서의 문제지? → 다른 개발자들의 기존의 해결 시도는 있었어? 어떻게 접근했어? 우린 그렇게 하면 안돼? 왜 안돼?
21:11 · 강정석 → 그럼 이렇게 해보면 안될까? → 해보겠습니다 → 왜 되지? → 그럼 다른 케이스가 있지 않을까?
21:20 · 뀨 영광이죠
21:28 · twojay 비판적 사고력
21:28 · twojay 오리지널리티
21:29 · 뀨 이렇게 글쓰실거면 ai 쓰지마세요
21:29 · 뀨 직접쓰세요
21:31 · 뀨 아스트라가 좀 단정적이고
21:31 · 뀨 페이블이 좀 나이브하고?
21:34 · 뀨 opus5는 에러가 많긴해요
21:35 · 김위버 opus 5 한국말을 웰케 못하죠?
21:35 · 김위버 아니 오히려 다운그레이드 됨
해커톤·먹거리 잡담과 커뮤니티 분위기
기술 대화 사이에는 함께 해커톤을 하고 싶다는 말이 고기·살라미·중식 메뉴를 고르는 잡담으로 길게 이어졌다. 특정 식당이나 위치를 추천하는 링크는 제외했지만, AI 모델을 두고 치열하게 논의하던 방이 곧바로 음식과 모임 이야기로 전환되는 분위기는 그날의 흐름을 보여준다.
원본 대화 · 관련 메시지 발췌 · 16:59–17:03, 17:23–17:25
16:59 · 송윤일 와우 재밌겠네요
17:00 · 송윤일 다 같이 해커톤도 하고
17:02 · twojay 스페어립 하고싶다
17:02 · 강정석 저는 살라미를 썰겠습니다
17:02 · 강정석 집에서 살라미 썰어서 맥주랑 먹는데
17:23 · twojay 저는 삼선짬뽕과 차돌짬뽕과 마파두부 덮밥입니다
17:23 · twojay 골라주십시오
17:23 · 꿈나무 삼선 하겠습니다
17:23 · Hue 홀 vs 배달
17:25 · 꿈나무 중국집은 배달이지 !
확인이 필요한 내용
- Gemini 3.8·4, Claude·Codex·Astra·Fable·Opus의 모델명·버전·성능·환각·출시·가격·한도는 참여자 경험과 전언이므로 공식 문서와 반복 테스트가 필요하다.
- JEV의 실제 모델 구조·정확도·비용 절감률, 한국어·전문 도메인·RAG 전처리·리랭킹 적합성은 이 대화의 실험과 의견으로만 기록한다.
- Codex·Claude·Astra 리셋·구독·API 오류, Aside·Hermes·Orca·OpenCode·Uroboros의 현재 기능과 권한은 계정·버전별 확인이 필요하다.
- 에이전트 친화적 웹의
alt·시맨틱 태그·SEO·UI 힌팅 조합과 멀티에이전트 하네스의 효과는 실제 작업에서 검증해야 한다.