에이전트코리아 · 2026-09-16
AI 모델의 사용량·장애와 역할 분담, Aside 브라우저 자동화, 180B 로컬 모델 실험, STT 화자 분리, 하네스·멀티에이전트 최적화 대화를 정리했습니다.
오늘의 대화
모델 사용량과 429·503 오류, Astra·Luna·Sol·Fable·Codex의 역할 분담 이야기가 이어졌다. 오후에는 Aside 브라우저 자동화와 Playwright의 차이, 노트북에서 180B 로컬 모델을 구동한 실험, CPU·GPU 및 OpenRouter 실측 논의가 나왔고, STT 화자 분리 설계와 하네스·멀티에이전트 최적화로 화제가 확장됐다. 초보자의 Scrapling 설치 질문과 오래된 PhoneGap 서비스에 대한 개발 경험도 함께 기록할 만한 사례였다.
원문 인용의 화자명은 개인정보 보호를 위해 익명화했으며, 사진·봇 공지·외부 링크·계정 및 회사 식별 정보는 공개 Wiki에서 생략했다.
이야기 나온 주제
AI 모델 사용량·장애와 역할 분담
참여자들은 Astra Plus의 사용량 소진, Claude 플랜에서 Fable을 함께 쓰기 어려운 체감, Codex의 429·503 오류를 각자의 경험으로 공유했다. Astra로 작업 범위를 관리하고 Luna로 코딩하는 식의 역할 분담도 제안됐지만, 모델 이름별 성능·한도와 출시 전망은 이 대화의 관찰과 추정으로만 남아 있다.
원본 대화 · 관련 메시지 일부 발췌 · 07:35–07:57, 13:07–13:09
07:35 · 참여자 A 아스트라. 플러스로 뭘 못할듯싶네요 토큰 귀신..
07:53 · 참여자 B x20 써야 아스트라로 뭐를 시킬수 있더라구요.. Plus 로는 뭐 그냥 명령 한방에 5시간용량 그냥 사라짐. ㅠ ㅠ
07:57 · 참여자 C 그래도 지피티는 최상급모델. 써볼수는 있자나요 클로드는 프로쓰면 페이블도 못써요 맥스써야 가능
13:07 · 참여자 D 루나 좋습니다 싸고좋은 루나
13:09 · 참여자 E 6 sol이 곧 나온다고 하니
13:09 · 참여자 E 아스트라로 관리하고
13:09 · 참여자 E 루나로 코딩시키기
원본 대화 · 관련 메시지 일부 발췌 · 13:55–14:51
13:55 · 참여자 F 그래도 어제보단 잘 돌아가네요
13:55 · 참여자 F 어젠 뭐 채팅 치면 429~
13:55 · 참여자 G 요즘은 503도…
14:44 · 참여자 F 후,.,,, 429 계속 터지네
14:44 · 참여자 F 코덱스요 ㅠㅠ
14:48 · 참여자 H 이런데도 리셋을 안해?
14:49 · 참여자 I 6정도 켜놓고 하는데, 안티에서 터미널로 하거든요. 근데 터미널 수가 많아지다보면 은근 ui 가 불편해서 에이전트별로 편하게 관리할수있는 도구나 오픈소스가 있나해서요!
14:50 · 참여자 J 메모리 55기가잡아서
14:50 · 참여자 J 맥북 꺼졌네요
14:51 · 참여자 F 예전엔 12개 정도씩 돌렸는데
14:51 · 참여자 F 이젠 그냥 아스트라한테 범위잡아서 시킵니다
14:51 · 참여자 F 3~4개 정도
Aside 브라우저 자동화와 Playwright 비교
Aside를 Codex의 Computer Use나 Playwright와 비교하는 질문에서, 참여자들은 Aside를 브라우저 자체에 가까운 도구로, Playwright를 브라우저 제어 프레임워크로 설명했다. DOM·스크립트 기반 접근은 토큰과 시간을 줄일 수 있다는 장점과 함께 오작동 위험도 커질 수 있다는 의견이 함께 나왔다. 로그인 훅이나 계정 연동 절차는 공개 Wiki에 옮기지 않았다.
원본 대화 · 관련 메시지 일부 발췌 · 15:25–15:28, 23:32–23:37, 00:01–00:22
15:25 · 참여자 A 선배님들 코덱스도 웹브라우저 활용 잘하는데 Aside 요게 필요한 이유가있나요? 그리고 유료결제도 잇네요..
15:26 · 참여자 B 더…더… 효율적으로 말을 알아먹습니다.
15:26 · 참여자 B 코덱스가 아마 computer use 를 쓴다면 aside 는 스크립트 기반 DOM 접근이라
15:27 · 참여자 B 그만큼 위험하지만 그만큼 더 좋게 웹브라우저를 활용한다? 정도입니다
15:27 · 참여자 C 토큰이 적게 들고 시간이 절감됩니다
23:32 · 참여자 D aside가 저는 playwright?였나 이놈 대신 실제 개발 바이브코딩할때 참고하는 브라우저 용도로 쓰는데 ai한테 aside이용해서 프론트 개발하라하는데 이렇게 쓰는거맞나요?
23:34 · 참여자 E 플레이라이트는 브라우저를 제어하는 프에임워크고 aside는 브라우저 그 잡채 에요
23:37 · 참여자 D aside의 비교가능한 계층에 있는 서비스는 그럼 크롬, 엣지, comet이군요 감사합니다!!
00:01 · 참여자 F 코덱스에 그냥 aside 플러그인으로 넣을수 있을거에요
00:01 · 참여자 F prompt : aside로 테스트/검수하면서 해줘. 로 쓰고있습니다
00:22 · 참여자 G 어사이드 스모크테스트할때 써야겠다
180B 로컬 모델 실험과 소형 하드웨어
한 참여자가 RTX 5060 Laptop 8GB가 달린 노트북에서 4비트 양자화한 Qwen3.8-Flash-Next 176.94B MoE 모델을 로컬로 구동한 실험을 공유했다. VRAM 4.0GB, RAM 14.4GB, 모델 파일 93.3GiB, 생성 속도 4.17 ± 0.17 tok/s라는 측정값과 64GB RAM 미니 PC 이식 계획이 제시됐지만, 이는 개인 실험 보고이며 재현성과 공개 결과는 별도 확인이 필요하다.
원본 대화 · 관련 메시지 일부 발췌 · 15:33–15:48
15:33 · 실험 공유자 이번엔 8GB 노트북 GPU로 1,800억 파라미터입니다. Qwen3.8-Flash-Next(176.94B, MoE 512 전문가 중 10개 활성)를 제 노트북에서 로컬로 돌렸습니다.
15:33 · 실험 공유자 · VRAM 4.0 GB — RTX 5060 Laptop 8GB 카드의 절반
15:33 · 실험 공유자 · RAM 14.4 GB — 설치 31.4GB의 46%
15:33 · 실험 공유자 · 모델 파일 93.3 GiB — 4비트 양자화를 직접 만들었습니다
15:33 · 실험 공유자 · 생성 속도 4.17 ± 0.17 tok/s (256토큰, 반복 2회)
15:35 · 실험 공유자 목표는 미니PC에서 두자릿수 TOK/S를 기대하고요. 가능할거라 봅니다.
15:45 · 실험 공유자 AMD 라이젠 + 64GB RAM 이고 100만원대
15:46 · 실험 공유자 32GB도 되는데, 속도때문에 64GB 정도되면 두자릿수 나올거에요
15:48 · 실험 공유자 모델 깍고 다듬어서 만드는거에요. 극한까지 밀어붙이되 품질 저하 최소화해서요
CPU·GPU 선택과 OpenRouter 실측 리더보드
CPU로 AI를 학습하는 것이 가능한지에 대한 질문에서, 참여자들은 규모가 커질수록 GPU가 효율적이라는 경험을 공유했다. 같은 시간대에 한 참여자는 OpenRouter의 425개 모델에 유료 API 요청을 보내 반응속도 등을 직접 측정하는 리더보드를 만들었다고 설명했으며, LLM judge는 비용 때문에 사용하지 않았다고 밝혔다. 이 결과는 대화 속 개인 프로젝트의 측정 계획이다.
원본 대화 · 관련 메시지 일부 발췌 · 15:56–16:03
15:56 · 질문자 우리회사 대표님이 cpu로 ai 학습시킬수 있다고 주장하시는데
15:56 · 질문자 이거 어떻게 해야돼요?
15:56 · 실험 공유자 말리고 싶어요
15:56 · 실험 공유자 너무 비효율적일거에요
15:57 · 참여자 A CPU로 학습 가능한건 100M 정도까지가
15:58 · 실험 공유자 와~ 가성비 박살. 그냥 GPU 쪼가리라도 있는게 더 좋음
15:58 · 참여자 A GPU 돌리니까 하루이틀 뿅뿅이인데
15:58 · 실험 공유자 CPU로 1만년 걸릴일을 GPU로 1년만에 끝내시죠 ㅎㅎㅎ
16:00 · 실험 공유자 오픈라우터를 저도 사용하는데 추론 비용 대비 품질이 제각각이더라구요. 가격만 믿을수 없더군요.
16:01 · 실험 공유자 그래서 ‘오픈라우터 리더보드’를 만들어봤어요. 오늘 허깅에 공개할려구요. 오픈라우터 API로 전 모델을 실제 요청해서 실측값을 다 뽑았음
16:02 · 실험 공유자 API로 유료로 각 모델별로 토큰 요청 다 때린겁니다. 425개 전 모델
16:02 · 실험 공유자 오픈라우터 사이트에도 안 나오는 실측값을 그대로 다 수집했어요
16:02 · 실험 공유자 LLM 저지는 안하고 반응속도 등등을 측정했어요
16:03 · 실험 공유자 LLM 저지까지 하면 돈이 너무 많이 드니까요
STT CER·화자 분리와 소형 모델
STT의 CER을 낮추는 방법을 묻는 질문에 데이터 품질과 미학습 음성을 포함한 파인튜닝이 중요하다는 답이 나왔다. 스트리밍 화자 분리는 인식과 화자 인식을 별도 헤드로 병렬 추론하고, Trunk + 2 Head 구조와 약 2.5B 규모의 로컬 모델을 조합한다는 한 참여자의 구현 경험이 공유됐다. 구체적인 성능 수치와 재현 가능한 모델 정보는 확인되지 않았다.
원본 대화 · 관련 메시지 일부 발췌 · 16:27–16:40
16:27 · 질문자 여기 stt 고수 계세요? cer 낮출려면 어케 해야돼요?
16:28 · 참여자 A STT CER는…. 데이터가 다죠
16:28 · 질문자 그냥 api사용중인데 코드로는 낮추는거 불가능인가요?
16:31 · 질문자 groq 쓰는중인데 개싸서 바꾸고싶지 않은데
16:31 · 질문자 cer 5퍼미만으로 절대 안내려감..
16:36 · 참여자 B cer을 낮추는건 데이터긴하져
16:36 · 참여자 B 한국어라고하면 오픈 데이터셋 가져와 파인튜닝해서 개선이 되기도하지만,
16:36 · 참여자 B 결국 한번도 안들어본 음성을 데이터셋으로 넣어주는게
16:36 · 참여자 B 제일 성능개선에 좋아요
16:36 · 질문자 stt는 파인튜닝 어케해요?
16:37 · 질문자 스트리밍 화자분리 넣고싶어요
16:37 · 참여자 A 스트리밍에 화자 분리면 저희는 인식용이랑 화자 분리랑 따로 두고 있어요
16:37 · 참여자 A Trunk + 2 Head로
16:37 · 참여자 A 공통 인식에서 router가 아니라 그냥 병렬 추론으로
16:38 · 참여자 A 화자인식 1개, 그리고 인식에 1개
16:38 · 참여자 A 스트리밍 되는 화자 분리되는 로컬 모델
16:38 · 참여자 A 2.5B 수준이라
16:38 · 참여자 A 백본을 Qwen 꺼로해서..
16:40 · 참여자 A OCR | PII | ASR 이런 소형모델 전문으로 가는중
하네스·멀티에이전트·스킬 최적화
모델을 키우면 병목과 비용이 커지고, 모델을 낮추면 품질이 의심된다는 이른바 교환비가 멀티에이전트 운영의 현실적인 문제로 제시됐다. 하네스는 규칙·구조·테스트를 쌓는 작업이며, 너무 강하게 제한하면 자율성이 줄고 너무 느슨하면 방향을 잃을 수 있다는 설명이 나왔다. 사실확인 훅과 반복 토론을 붙인 연구 사례, 목적이 모호하면 자체 스킬 유지가 어려워진다는 회고도 이어졌다.
원본 대화 · 관련 메시지 일부 발췌 · 22:24–22:33, 23:07–23:20
22:24 · 참여자 A 저는 교환비의 저주에 빠져있습니다
22:24 · 참여자 A 모델을 올리면 병목의 늪에 빠지고
22:25 · 참여자 A 모델을 낮추면 품질이 의심되고
22:26 · 연구 참여자 제가 그래서 멀티에이전트를 시도하기시작했는데 이것도 쉽지않네요 ㅋㅋㅋㅋㅋ
22:26 · 연구 참여자 토론하고 자기들끼리 수렴안되는거 판정하는것도 엄청난 노동력..
22:27 · 참여자 A 결국 최적화가 노하우 같아요
22:31 · 참여자 B 그 하네스한테 수만 가지 규칙을 정의하고 구조를 만들고 테스트 해야하니까요, 자율주행차는 목적지만 입력하면 되지만 우리는 자율주행 시스템을 만들어야하니 수만번 고치고 테스트해야죠
22:31 · 참여자 B 개발자가 편하면 사용자가 불편해지고, 하네스 만드는 사람이 편하면 하네스로 만든게 불편함을 유발하는거 같아요
22:32 · 참여자 B 너무 꽉 조이면 시키는것만 하거나 진행하는게 어렵고, 너무 느슨하면 원하는 방향이랑 상관없이 가니
22:32 · 참여자 B 잘 조율을 해야되는거 같아요
22:33 · 연구 참여자 지금은 토론은 풀어줬는데 토론후에 애들이 추론오류 생기면 한 세번까지 토론해보고 저한테 가져오게 만들어놨는데
23:07 · 참여자 C 어디까지 자율로 하고 어디까지 선택으로 할지가 정말 어려워요.
23:14 · 참여자 D 앱샷 md파일제작하고 번역하는 스킬 제작하고 옵시디언 확장프로그램을 사용해 보고 깨달은 것은 너무 기본적인 것에 자체 스킬을 제작했다는 것을 깨달았네요. 진정으로 gpt사용방안에 대해 생각해 보게 되는 계기가 됐습니다. 그리고 목적이 중요하다는 것을
23:15 · 참여자 D 지금까지 목적을 애매하게 잡고 스킬을 제작했는데 이게 유지가 어렵더군요
23:20 · 참여자 C 미리 기획 구체화하고 실행은 ai 맡기는 방식이 전 잘 맞는 거 같아요
Scrapling 설치 질문과 GitHub 입문
한 초보 참여자가 Scrapling 설치 방법을 물었고, Python 설치 뒤 pip 또는 pip3 명령을 사용하라는 답을 받아 실제 설치에 성공했다고 알렸다. 저장소의 Quickstart를 먼저 확인하고 터미널 에이전트에게 설치·설정을 요청하는 방법도 함께 언급됐다.
원본 대화 · 관련 메시지 발췌 · 13:40–13:43
13:40 · 질문자 저 고수님들 저 완전 쌩초보인데요.. 이거 설치하라고 하는데 이건 어떻게 서설치하는건지 알고싶습니다!
13:40 · 참여자 A 링크 주시고 설치해줘~ 외쳐보세영
13:41 · 참여자 A 터미널의 에이전트에게 그대로 주시고
13:41 · 참여자 A 설치 및 세팅해주고 어떻게사용하는지 알잘딱 설명해줘~
13:42 · 참여자 B 파이썬 설치하시고 pip install scrapling 때리면
13:42 · 참여자 B 파이선3면 pip3 install scrapling
13:42 · 질문자 아 pip3이라고 써야되는군요..ㅎㅎㅎㅎ
13:43 · 질문자 되네요 되요!!아 감사합니다!!
레거시 개발 스택의 유지보수 경험
오래된 PhoneGap과 2000년대 초반 개발 방식이 여전히 동작하는 인수인계 서비스 사례가 농담 섞인 회고로 나왔다. 특정 회사나 서비스 식별 정보는 남기지 않고, 오래된 스택을 넘겨받는 개발자의 당혹감이라는 일반적인 경험만 기록한다.
원본 대화 · 관련 메시지 발췌 · 14:23–14:25
14:23 · 참여자 A 폰갭을 아직도 써?…
14:23 · 참여자 A 15년전꺼를?…
14:23 · 참여자 B 제가 인수인계 받은 서비스는
14:25 · 참여자 B 2026년에 왜
14:25 · 참여자 B 2000년대 초반 개발론이
14:25 · 참여자 B 아직도 동작하고 있는가
14:25 · 참여자 B 가산은 신비롭구나
14:25 · 참여자 B 내가 그간 참 좋은 회사들만 다녔구나….
확인이 필요한 내용
- Astra·Sol·Luna·Fable·Codex의 모델명, 출시 전망, 한도와 장애 원인은 참여자 경험 또는 추정이며 공식 공지로 확인하지 않았다.
- Aside의 내부 동작, 보안 경계, Playwright와의 비교 및 Codex 플러그인 동작은 참여자 설명을 정리한 것이므로 공식 문서와 실제 환경 검증이 필요하다.
- 180B 로컬 모델의 측정값·호환 하드웨어·공개 계획과 STT Trunk + 2 Head 구현의 성능은 이 대화만으로 재현·검증할 수 없다.
- OpenRouter 리더보드는 개인 프로젝트의 실측 계획이며, 품질 평가를 포함한 종합 벤치마크로 해석하지 않는다.