모델은 계획, 구현, 검토에서 서로 다른 모습을 보입니다. 연결되지 않은 도구에 흩어져 있으면 하나의 목표를 향해 함께 일하기 어렵습니다. AgentLoom은 여기서 출발해 사용량 한도, 맥락의 연속성, 자리를 비운 동안의 제어 문제를 풀어 갑니다. 코딩은 더 넓은 작업 공간을 향한 첫 번째 실전 무대입니다.
01 / 작업에 맞게 모델을 배치하기
서로 다른 모델이 하나의 작업 공간에서 힘을 보태도록 하고 싶었습니다. 리더는 목표를 나누고 작업을 배정하며 결과를 모읍니다. 계획, 구현, 검토에는 작업 성능, 비용, 가용성을 고려해 서로 다른 모델 구성을 사용할 수 있습니다.
협업에도 비용이 듭니다. 담당 범위가 모호하면 수정이 겹칠 수 있고, 하위 작업이 끝났다고 전체 목표가 달성되는 것도 아닙니다. 작업 공간에는 누가 무엇을 맡았는지, 어떤 결과를 냈는지가 보여야 하며 통합 후 검증도 필요합니다.
서로 다른 모델, 하나의 목표
리더가 작업을 나누고 결과를 모아 검증을 조율합니다
목표를 나누고 범위를 정하기
작업별로 모델 선택하기
변경 사항과 결과 확인하기
역할을 설명한 개요입니다. 모델 선택은 작업과 설정에 따라 달라지며, 모델의 강점을 고정된 순위로 매긴 것이 아닙니다.

02 / 모델이 바뀌어도 작업은 계속
모델의 사용량 한도가 소진되면 같은 세션에서 제공업체를 바꾸고 기존 맥락을 이어 갈 수 있습니다. 아직 끝나지 않은 작업에 계속 집중할 수 있습니다.
이와 별도로 인계 문서를 만들고 연결된 하위 세션을 여는 이어가기 기능도 있습니다. 두 방식은 서로 다릅니다. 모델마다 맥락을 다르게 해석할 수 있으므로, 작업을 이어 가려면 맥락과 상태를 명확히 관리해야 합니다.
03 / MyAgent를 직접 만든 이유
제가 이해한 에이전트 아키텍처로 실제 작동하는 시스템을 만들 수 있는지 확인하고 싶었습니다. Claude Code나 Codex 같은 CLI 에이전트를 설치하지 않은 사람도 모델 API 키만으로 AgentLoom을 쓸 수 있게 하고 싶었습니다.
장기적으로는 앞으로 만들 제품을 위해 직접 이해하고 제어하며 수정할 수 있는 엔진을 원했습니다. 그 대가도 분명했습니다. 모델 연동, 도구 실행, 맥락 관리, 검증을 모두 책임져야 했습니다.
작업 공간과 엔진
작업, 세션, 결과 확인
외부 CLI 에이전트 또는 MyAgent
맥락을 해석하고 행동 제안
실행하고 결과 확인
04 / 자리를 비워도 제어하기
작업에는 시간이 걸리지만, 끝날 때까지 책상 앞에 머물고 싶지는 않습니다. Remote Control은 QR 코드로 휴대폰 브라우저를 연결해 세션을 보고 메시지를 보내거나 단계를 승인하고 작업을 중지할 수 있게 합니다. VPN 설정은 필요하지 않습니다.
작업은 계속 데스크톱에서 실행되므로 컴퓨터가 온라인 상태를 유지해야 합니다. 릴레이는 서로 다른 네트워크의 기기를 연결하고 종단 간 암호화된 내용을 전달하며, 연결 메타데이터도 처리합니다. 편의성, 제어권, 네트워크 경계를 함께 설계합니다.
자리를 비워도 작업은 내 컴퓨터에서.
QR로 연결하고 메시지·승인·중지
종단 간 암호화된 내용 전달
로컬 작업 공간에서 작업 실행
두 기기 모두 릴레이로 아웃바운드 연결을 맺으므로 VPN 설정은 필요하지 않습니다. 데스크톱은 온라인 상태여야 합니다. 연결 메타데이터는 콘텐츠 암호화 범위에 포함되지 않습니다. 화살표는 경로를 나타내며 실제 통신은 양방향입니다.
05 / 작업이 끝났다는 것을 어떻게 확인할까?
같은 실행 환경에서도 모델마다 행동은 다릅니다. 어떤 모델은 정보를 더 모으고, 어떤 모델은 일찍 실행에 옮깁니다. 실제 작업을 통해 도구와 맥락을 언제 조정해야 하는지, 결과를 언제 더 명시적으로 검증해야 하는지 배웠습니다.
모델의 완료 메시지는 결과를 확인하라는 신호입니다. 도구 호출이 성공했거나 부실한 자체 테스트를 통과했다고 사용자의 문제가 해결된 것은 아닙니다. 완료 판단은 원래 작업과 관찰 가능한 결과로 돌아가야 합니다.

평가 자료를 읽는 방법
내부 기록은 SWE-bench Verified에서 직접 고른 30개 과제를 여러 엔진 빌드로 8회 실행했으며 중앙값은 17/30이었습니다. 전체 500개 과제의 결과도, 고정된 빌드를 8회 반복한 결과도 아닙니다. 특정 실험에서의 행동을 설명하는 자료이며 전체 벤치마크 순위나 실제 사용자 확산을 입증하지는 않습니다.
현재 제품의 위치
AgentLoom은 다운로드할 수 있으며 제가 매일 사용하는 도구입니다. 이후 MyAgent는 LoomVoice의 백그라운드 작업에도 재사용되었습니다. 이 재사용은 구체적인 성과입니다. 더 많은 사람이 쉽게 설치하고 설정하도록 만드는 일은 계속 남아 있습니다.