Liquid AI d1-omni, 공개 47분 만에 브라우저 구동 데모 등장
Liquid AI가 오픈웨이트 결정 모델 d1-3B(텍스트+이미지)와 실험적 d1-omni-600M(텍스트+이미지 또는 텍스트+오디오)을 공개한 뒤, 약 47분 만에 ruNNtime 기반 브라우저 구동 데모 영상이 게시됐습니다. WebGPU 환경에서 동작하며 정식 패키지 릴리스 전 ba
Liquid AI가 오픈웨이트 결정(decision) 모델 2종을 공개한 2026년 10월 7일(미국 시간 기준), 개발자 Jakub Chmura(@_jakubchmura)가 그중 d1-omni-600M을 브라우저에서 구동하는 데모 영상을 X에 게시했습니다. 게시 시각은 한국 시간 2026년 10월 8일 02:50이며, 작성자 본인의 표현에 따르면 d1-omni 공개 약 47분 만의 일입니다.

이미지 출처: @_jakubchmura / X (demo video still)
이번 데모는 Software Mansion의 브라우저 추론 라이브러리 ruNNtime을 사용한 것으로, 작성자는 AI 모델의 브라우저 포팅을 간편하고 에이전트 친화적으로 만드는 것이 ruNNtime의 주요 목표라고 밝혔습니다. Software Mansion 공식 계정도 해당 게시물에 "forget day 0 support, this is minute 47 support"라는 반응을 남겼습니다.
공개된 모델 2종: d1-3B와 실험적 d1-omni-600M
Liquid AI의 공식 블로그 게시물(Open d1)에 따르면, 이번에 공개된 오픈웨이트 모델은 d1-3B와 d1-omni-600M 2종입니다. 두 모델의 입력 범위는 명확히 구분됩니다.
- d1-3B: 텍스트와 이미지를 입력으로 받는 결정 모델입니다.
- d1-omni-600M: 텍스트와 이미지를 함께 입력하거나, 텍스트와 오디오를 함께 입력하는 실험적(experimental) 모델입니다. 텍스트·이미지·오디오 3개를 동시에 입력한다는 의미가 아닙니다.
Liquid AI는 두 체크포인트를 Hugging Face에서 공개했으며, DGX부터 RTX 워크스테이션, 엣지의 Jetson까지 NVIDIA 스택 전반에서의 실시간 의사결정을 목표로 제시했습니다. 결정 모델은 출력 토큰을 생성하지 않고 단일 포워드 패스로 정형 답변을 반환하는 방식이라고 설명합니다. d1-omni-600M은 초기 연구 릴리스(early research release)로 활발히 개발 중이라는 점도 블로그에 명시되어 있습니다.
Liquid AI 관계자 Ramin의 게시물에 따르면 이 시리즈는 NVIDIA와의 협업으로 나온 오픈웨이트 멀티모달 결정 모델이며, 600M omni 모델이 이미지·오디오·텍스트를 처리합니다. Maxime Labonne의 별도 게시물에서는 Hugging Face 인터랙티브 게임 스페이스도 함께 제공된다고 밝혔습니다.
브라우저 데모의 내용과 현재 한계
데모 영상 자체는 짧은 화면 녹화이며, 정량 지표는 공개되지 않았습니다. 확인된 사실과 작성자 본인의 답변만으로 정리하면 다음과 같습니다.
- 실행 환경: WebGPU가 있으면 어디서든 실행 가능하다는 것이 작성자의 설명입니다. React Native와 Electron도 가능하다고 밝혔습니다.
- 현재 상태: 작성자는 현 데모가 "pretty barebones" 상태이며, 여러 질문에 대비한 컨텍스트 캐싱을 아직 지원하지 않는다고 답했습니다. 패키지 정식 릴리스 전에 관련 작업을 진행 중이라고 덧붙였습니다.
- 미공개 지표: 최초 토큰 지연시간, 양자화 후 다운로드 용량, 오디오 입력 시 성능 같은 수치는 공개되지 않았고, 댓글의 관련 질문에도 답변이 달리지 않았습니다.
즉 현재 시점에서 일반 사용자가 바로 쓸 수 있는 배포물은 데모 영상 수준에 한정되며, ruNNtime 패키지 릴리스는 예고 상태입니다. 브라우저 데모의 체감 속도와 로딩 비용을 판단할 근거는 아직 없습니다.
실무적 의미: 결정 모델의 브라우저 실행이 빨라지는 이유
d1 계열은 긴 텍스트를 생성하는 모델이 아니라, 입력에 대한 판정을 한 번에 반환하는 결정 모델입니다. 이런 구조는 브라우저·엣지 같은 가벼운 환경과 궁합이 좋습니다. 출력 토큰을 순차 생성하지 않으니 지연시간 구조가 단순하고, 개인정보 필터링·분류·라우팅 같은 작업에 적합합니다.
작성자가 ruNNtime을 "TypeGPU 위의 순수 TypeScript" 스택으로 설명한 점도 주목할 만합니다. WASM 없이 코어 연산(matmul, attention, norm 등)으로 모델을 직접 기술하고, 가중치를 Hugging Face safetensors에서 그대로 불러온다는 것입니다. 다만 이 설명은 별도 미러 게시물의 내용이며, 이번 47분 데모 자체의 구성과 동일하다고 단정할 수는 없습니다.
d1-omni-600M이 실험적 릴리스라는 점을 감안하면, 이번 데모의 의미는 성능 입증보다는 포팅 속도에 있습니다. 오픈웨이트 공개 직후 브라우저 런타임에 올리는 경로가 이미 작동한다는 사실 자체가 소식의 핵심입니다.
출처
- Liquid AI 공식 블로그: Open d1: Edge decision models for text, vision, and audio
- Jakub Chmura 데모 원문 (@_jakubchmura): 47 minutes since the release of d1 omni...
- ruNNtime 저장소 (Software Mansion): software-mansion/runntime
- Ramin 게시물 (NVIDIA 협업·600M omni 언급): Ramin @ramin_m_h
- Maxime Labonne 게시물 (d1-3B·d1-omni-600M 입력 구성·HF 스페이스 언급): Maxime Labonne @maximelabonne