TAU-HOME.COM
LOADING

GitHub Copilot, 온디바이스 로컬 모델 'MAI-Code-1.1-Flash' 지원 발표…로컬 추론 무료화

마이크로소프트가 GitHub Copilot에 온디바이스 로컬 추론 모델 MAI-Code-1.1-Flash를 도입해 추가 추론 비용 없이 256K 컨텍스트의 에이전틱 코딩을 로컬에서 지원합니다.

tau · 2026년 10월 8일

#GitHub Copilot #Microsoft #MAI-Code #온디바이스 AI #AI 코딩

GitHub Copilot, 온디바이스 로컬 모델 'MAI-Code-1.1-Flash' 지원 발표…로컬 추론 무료화

마이크로소프트(Microsoft)가 2026년 10월 7일(현지 시각), GitHub Copilot 환경에서 사용자 기기의 로컬 연산 자원으로 직접 구동되는 온디바이스 코딩 모델 'MAI-Code-1.1-Flash' 지원을 공식 발표했습니다. 클라우드 API 호출에 의존하던 기존 에이전틱 코딩 파이프라인의 일부를 로컬 엣지 연산으로 전환하여, 별도의 모델 추론 비용(Inference Charge) 없이 개발 작업을 수행할 수 있도록 한 조치입니다.

GitHub Copilot 온디바이스 로컬 모델 MAI-Code-1.1-Flash 발표 그래픽

이미지 출처: Microsoft / Microsoft AI

이번 발표는 클라우드 토큰 비용 부담을 낮추고 민감한 코드베이스의 외부 전송을 최소화하려는 엔지니어링 요구를 반영한 것으로, 전용 신경망 가속 하드웨어를 탑재한 차세대 PC 환경과 통합된 보안 샌드박스를 핵심 기반으로 삼고 있습니다.

137B 총 파라미터·6.8B 활성 MoE 구조와 256K 컨텍스트 윈도우

온디바이스 로컬 실행을 위해 도입된 MAI-Code-1.1-Flash는 마이크로소프트 AI가 개발한 소형 코딩 특화 모델입니다.

전체 1,370억 개(137B)의 파라미터를 갖추고 있으나, 실행 시점에는 라우팅을 거쳐 68억 개(6.8B)의 파라미터만 활성화되는 혼합 전문가(Mixture-of-Experts, MoE) 구조를 채택했습니다. 이를 통해 로컬 디바이스의 제한된 연산 자원에서도 높은 효율성을 확보했습니다.

  • 256K 레퍼런스 컨텍스트 윈도우: 256,000(256K) 토큰 크기의 컨텍스트 길이를 제공해 복잡한 멀티 파일 프로젝트와 저장소 단위 맥락을 로컬 추론 단계에서도 유지합니다.
  • 양자화 및 추측 디코딩 적용: 메모리 점유 면적을 줄이고 엔드투엔드 응답 속도를 개선하기 위해 온디바이스 양자화(Quantization)와 추측 디코딩(Speculative Decoding) 기술이 결합되었습니다. 에이전트 루프에서 필수적인 작업 완수율과 도구 사용(Tool Use) 정확도를 유지하도록 조정되었습니다.
  • 하드웨어 가속: Surface Laptop Ultra와 같이 NVIDIA RTX Spark를 탑재한 Windows PC 등 엣지 하드웨어 가속을 기반으로 반응성 높은 로컬 코딩 경험을 지원합니다.

하이브리드 지능: Auto 자동 라우팅과 명시적 로컬 엔드포인트 선택

GitHub Copilot은 로컬 모델을 활용하는 두 가지 작업 경로를 제공합니다. 지원 환경은 GitHub Copilot CLI, Copilot 전용 데스크톱 앱, 그리고 Visual Studio Code를 비롯한 IDE 확장 전반에 적용됩니다.

  • 지능형 Auto 오케스트레이션: 마이크로소프트의 HydraFusion 오케스트레이션 방식을 기반으로, 작업 맥락과 멀티턴 세션의 캐시 상태를 종합해 온디바이스 로컬 모델과 클라우드 대형 모델 사이에서 실행 위치를 자동으로 조율합니다. 세션 진행에 따라 축적된 캐시 자원을 보존하면서 최적의 실행 경로를 선택합니다.
  • 명시적 모델 선택(Explicit Selection): 사용자가 실행 환경을 직접 통제해야 하는 워크플로를 위해 Windows ML 프로바이더를 통해 MAI-Code-1.1-Flash를 직접 지정할 수 있습니다. 또한 OpenAI 호환 로컬 엔드포인트 연결을 지원하여 로컬에 호스팅된 다른 모델로 직접 라우팅하는 방식도 가능합니다.

마이크로소프트는 로컬 모델 추론을 선택하더라도 도구 실행과 세션 관리 경계는 별개로 작동하므로, 로컬 추론 활성화가 곧 완전한 오프라인 세션을 의미하는 것은 아니라고 명시했습니다.

MXC 프로세스 샌드박스 격리와 롤아웃 일정·하드웨어 요구사항

로컬 머신에서 자율적으로 명령을 실행하는 에이전틱 코딩의 특성상 시스템 보안 격리 체계도 함께 공개되었습니다.

마이크로소프트는 Windows 팀의 오픈소스 라이브러리인 '마이크로소프트 실행 컨테이너(Microsoft Execution Containers, MXC)'를 Copilot에 적용했습니다. 별도의 가상 머신(VM)이나 무거운 컨테이너 이미지를 띄우지 않고도 네이티브 운영체제 수준의 프로세스 격리를 구현합니다.

  • 플랫폼별 격리 백엔드: Windows에서는 ProcessContainer의 BaseContainer 계층을 사용하며, macOS에서는 Seatbelt, Linux에서는 bubblewrap을 백엔드로 연동합니다.
  • 격리 대상: 샌드박스가 활성화되면 셸 명령과 로컬 모델 컨텍스트 프로토콜(MCP) 서버, 언어 서버(LSP)가 프로세스 격리 경계 내부에서 실행되어 시스템 위협을 차단합니다.

배포는 2026년 10월 말부터 제한된 사용자 그룹을 대상으로 순차 시작(Limited Rollout)될 예정입니다. 마이크로소프트는 기기 내 로컬 모델 호출에 대해 별도의 추론 비용이 발생하지 않는다고 발표했으나, 상용 구독 티어별 구체적인 사용 한도나 세부 정책은 정식 배포 시점에 추가 문서화될 것으로 보입니다. 아울러 MoE 구조임에도 256K 컨텍스트를 안정적으로 처리하기 위해서는 충분한 고성능 하드웨어 자원이 필요하다는 점이 실무 도입 시 주요 검토 사항입니다.

출처