개발 이야기 / AGENTLOOM

서로 다른 모델이 함께 일하고, 주도권은 사용자에게.

작업 분담, 맥락 이어가기, 원격 제어, 직접 다듬을 수 있는 엔진까지. 여러 모델의 강점을 하나의 작업 흐름에 담았습니다.

모델은 계획, 구현, 검토에서 서로 다른 모습을 보입니다. 연결되지 않은 도구에 흩어져 있으면 하나의 목표를 향해 함께 일하기 어렵습니다. AgentLoom은 여기서 출발해 사용량 한도, 맥락의 연속성, 자리를 비운 동안의 제어 문제를 풀어 갑니다. 코딩은 더 넓은 작업 공간을 향한 첫 번째 실전 무대입니다.

01 / 작업에 맞게 모델을 배치하기

서로 다른 모델이 하나의 작업 공간에서 힘을 보태도록 하고 싶었습니다. 리더는 목표를 나누고 작업을 배정하며 결과를 모읍니다. 계획, 구현, 검토에는 작업 성능, 비용, 가용성을 고려해 서로 다른 모델 구성을 사용할 수 있습니다.

협업에도 비용이 듭니다. 담당 범위가 모호하면 수정이 겹칠 수 있고, 하위 작업이 끝났다고 전체 목표가 달성되는 것도 아닙니다. 작업 공간에는 누가 무엇을 맡았는지, 어떤 결과를 냈는지가 보여야 하며 통합 후 검증도 필요합니다.

서로 다른 모델, 하나의 목표

목표와 완료 기준은 사용자가 정합니다

리더가 작업을 나누고 결과를 모아 검증을 조율합니다

01계획

목표를 나누고 범위를 정하기

02구현

작업별로 모델 선택하기

03검토

변경 사항과 결과 확인하기

통합 → 검증 → 사용자가 승인하거나 수정 요청

역할을 설명한 개요입니다. 모델 선택은 작업과 설정에 따라 달라지며, 모델의 강점을 고정된 순위로 매긴 것이 아닙니다.

배정된 작업과 결과를 보여 주는 AgentLoom 리더 및 모델 팀원
그림 01제품 화면: 리더 아래에 팀원의 작업이 펼쳐지고 사이드바에 팀 구성이 표시됩니다. 역할은 작업별로 설정하며 모델 이름은 이 화면을 기록한 버전을 기준으로 합니다.

02 / 모델이 바뀌어도 작업은 계속

모델의 사용량 한도가 소진되면 같은 세션에서 제공업체를 바꾸고 기존 맥락을 이어 갈 수 있습니다. 아직 끝나지 않은 작업에 계속 집중할 수 있습니다.

이와 별도로 인계 문서를 만들고 연결된 하위 세션을 여는 이어가기 기능도 있습니다. 두 방식은 서로 다릅니다. 모델마다 맥락을 다르게 해석할 수 있으므로, 작업을 이어 가려면 맥락과 상태를 명확히 관리해야 합니다.

03 / MyAgent를 직접 만든 이유

제가 이해한 에이전트 아키텍처로 실제 작동하는 시스템을 만들 수 있는지 확인하고 싶었습니다. Claude Code나 Codex 같은 CLI 에이전트를 설치하지 않은 사람도 모델 API 키만으로 AgentLoom을 쓸 수 있게 하고 싶었습니다.

장기적으로는 앞으로 만들 제품을 위해 직접 이해하고 제어하며 수정할 수 있는 엔진을 원했습니다. 그 대가도 분명했습니다. 모델 연동, 도구 실행, 맥락 관리, 검증을 모두 책임져야 했습니다.

작업 공간과 엔진

01작업 공간

작업, 세션, 결과 확인

02실행

외부 CLI 에이전트 또는 MyAgent

03모델

맥락을 해석하고 행동 제안

04도구 및 검증

실행하고 결과 확인

역할별 책임의 개요이며 전체 런타임 구조도는 아닙니다. 외부 에이전트와 MyAgent는 서로 다른 실행 경로를 사용합니다.

04 / 자리를 비워도 제어하기

작업에는 시간이 걸리지만, 끝날 때까지 책상 앞에 머물고 싶지는 않습니다. Remote Control은 QR 코드로 휴대폰 브라우저를 연결해 세션을 보고 메시지를 보내거나 단계를 승인하고 작업을 중지할 수 있게 합니다. VPN 설정은 필요하지 않습니다.

작업은 계속 데스크톱에서 실행되므로 컴퓨터가 온라인 상태를 유지해야 합니다. 릴레이는 서로 다른 네트워크의 기기를 연결하고 종단 간 암호화된 내용을 전달하며, 연결 메타데이터도 처리합니다. 편의성, 제어권, 네트워크 경계를 함께 설계합니다.

자리를 비워도 작업은 내 컴퓨터에서.

01휴대폰 브라우저

QR로 연결하고 메시지·승인·중지

02인터넷 릴레이

종단 간 암호화된 내용 전달

03데스크톱 AgentLoom

로컬 작업 공간에서 작업 실행

두 기기 모두 릴레이로 아웃바운드 연결을 맺으므로 VPN 설정은 필요하지 않습니다. 데스크톱은 온라인 상태여야 합니다. 연결 메타데이터는 콘텐츠 암호화 범위에 포함되지 않습니다. 화살표는 경로를 나타내며 실제 통신은 양방향입니다.

05 / 작업이 끝났다는 것을 어떻게 확인할까?

같은 실행 환경에서도 모델마다 행동은 다릅니다. 어떤 모델은 정보를 더 모으고, 어떤 모델은 일찍 실행에 옮깁니다. 실제 작업을 통해 도구와 맥락을 언제 조정해야 하는지, 결과를 언제 더 명시적으로 검증해야 하는지 배웠습니다.

모델의 완료 메시지는 결과를 확인하라는 신호입니다. 도구 호출이 성공했거나 부실한 자체 테스트를 통과했다고 사용자의 문제가 해결된 것은 아닙니다. 완료 판단은 원래 작업과 관찰 가능한 결과로 돌아가야 합니다.

AgentLoom 파일 변경 및 검토 패널
그림 02제품 화면: 구체적인 변경 사항을 확인한 후 승인하거나 추가 수정을 요청합니다.
평가 자료를 읽는 방법

내부 기록은 SWE-bench Verified에서 직접 고른 30개 과제를 여러 엔진 빌드로 8회 실행했으며 중앙값은 17/30이었습니다. 전체 500개 과제의 결과도, 고정된 빌드를 8회 반복한 결과도 아닙니다. 특정 실험에서의 행동을 설명하는 자료이며 전체 벤치마크 순위나 실제 사용자 확산을 입증하지는 않습니다.

현재 제품의 위치

AgentLoom은 다운로드할 수 있으며 제가 매일 사용하는 도구입니다. 이후 MyAgent는 LoomVoice의 백그라운드 작업에도 재사용되었습니다. 이 재사용은 구체적인 성과입니다. 더 많은 사람이 쉽게 설치하고 설정하도록 만드는 일은 계속 남아 있습니다.