개발 이야기 / LOOMVOICE

가족의 일상에 음성 비서를 들이기까지

아이들이 쓰는 교과서에서 출발해 음질, 인터랙션, 기기 제약을 하나씩 풀어 갔습니다.

아이들이 휴대폰 없이 학교에서 실제로 쓰는 교과서를 바탕으로 AI와 대화할 수 있기를 바랐습니다. 단순해 보였던 음성 인터페이스는 지식, 하드웨어, 일상의 경험을 아우르는 제품 문제로 이어졌습니다.

책, 음성, 노트, 알림을 연결한 콘셉트 장면
그림 01Blender와 AI 이미지 생성으로 만든 학습, 음성, 일상 행동의 콘셉트 이미지입니다. 제품 하드웨어가 아니며 실제 장비는 영상에서 볼 수 있습니다.

가족의 피드백을 구체적인 변화로

01관찰

영어가 너무 빠름; 다른 비서를 불러도 전환되지 않음

02조정

역할별 속도 조정; 발화 중단 후 전환

03다시 사용

같은 인터랙션을 반복하고 결과 확인

프로토타입 개선 기록을 바탕으로 한 내용입니다. 피드백이 설계를 어떻게 바꿨는지를 보여 주며 모든 소음·거리 조건이 해결되었다는 뜻은 아닙니다.

01 / 대화만으로는 충분하지 않습니다

첫 버전은 느리고 음질이 좋지 않았으며 주변 소음에 민감했습니다. 기기가 말하는 동안 새 지시를 받기 어려워 가족이 시스템을 기다려야 했습니다.

전이중 오디오와 에코 제거를 갖춘 스피커폰으로 오디오 조건이 나아졌습니다. 하지만 동시 재생과 녹음이 소프트웨어의 발화 중단 처리까지 자동으로 해결하지는 않습니다. 호출 감지, 취소, 역할 전환은 각각 처리해야 합니다.

02 / 기기 자원과 음성 품질

Raspberry Pi의 자원은 로컬 음성 모델에 제약을 주었습니다. 더 자연스러운 목소리를 위해 대체 경로를 유지하면서 클라우드 음성 서비스를 도입했습니다. 네트워크 연결, 서비스 가용성, 비용도 제품의 일부가 되었습니다.

로컬 기기에서 실행하는 것과 모든 처리를 로컬에서 하는 것은 다릅니다. 경험은 전체 처리 흐름에 달려 있으며, 음성 서비스의 첫 오디오 조각 도착 시간은 대화의 전체 지연 시간을 나타내지 않습니다.

음성 인터랙션과 백그라운드 작업

01로컬 기기

녹음, 재생, 호출 감지

02음성 대화

비서 선택과 진행 중인 대화

03지식 및 서비스

출처, 모델, 음성 서비스

04백그라운드 작업

MyAgent가 일부 백그라운드 작업 처리

역할별 책임의 경계를 나타냅니다. 백그라운드에서 MyAgent를 재사용한다고 모든 실시간 음성 요청이 같은 에이전트 루프를 거치는 것은 아닙니다.

03 / 실제 사용이 설계를 바꾸도록

“영어가 너무 빨라요”라는 말은 역할별 속도 조정으로 이어졌습니다. 말하는 도중 다른 비서를 부르자 발화 중단 후 전환 문제가 드러났습니다. 이런 작은 관찰이 긴 기능 목록보다 다음 할 일을 더 분명하게 알려 주었습니다.

교과서 연동도 눈에 보이는 근거가 필요합니다. 데모에서는 답변과 원문 자료를 나란히 보여 주어 어떻게 활용되는지 확인할 수 있게 합니다. 이것이 측정된 학습 효과를 뜻하지는 않습니다.

집에서 일상적으로 잘 쓰이게 만든 다음, 더 많은 사람이 쉽게 설치하고 설정할 수 있게 만들고자 합니다.

프로토타입에서 더 쉬운 제품으로

현재는 가정용 프로토타입이며 공개 설치 파일이나 소스 코드는 없습니다. 다음 방향은 설정을 단순화하고 Raspberry Pi 이외의 기기에서 검증하는 것입니다. 각 운영체제의 오디오, 권한, 의존성, 업데이트를 다뤄야 합니다.