Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Back to blog

Meituan LongCat-2.0 리뷰: 중국 국산 AI ASIC 클러스터에서 학습·배포된 1.6T Agentic Coding 모델

MeituanLongCat-2.0중국 AI국산 컴퓨트Agentic coding오픈소스 LLMAI ASIC

Meituan LongCat-2.0 공식 릴리스 커버

Meituan LongCat-2.0을 검색하고 있다면 또 하나의 일반 출시 글만 찾는 것은 아닐 가능성이 큽니다.

정말 알고 싶은 것은 다음일 것입니다.

  • 이 모델이 실제로 중국 국산 컴퓨트 스택에서 학습되고 배포되었는가
  • 주로 채팅 모델인가, 아니면 agentic coding을 위해 만들어졌는가
  • 개발자, API 통합자, 기업 팀이 진지하게 테스트할 단계에 왔는가

저는 Meituan의 2026년 6월 30일 공식 기술 블로그, 공식 LongCat-2.0 GitHub README, Hugging Face 모델 카드를 나란히 검토했습니다. 결론은 비교적 직접적입니다.

LongCat-2.0이 중요한 이유는 크거나 오픈소스라는 점만이 아닙니다. Meituan이 국산 인프라, 조 단위 파라미터 규모, end-to-end 학습과 추론, 명확한 agentic coding 지향을 공개적으로 한데 묶었다는 점입니다.

그리고 먼저 용어를 정확히 하는 것이 좋습니다. 이 범주는 흔히 “중국 GPU로 학습된 모델”이라고 대충 불리지만, Meituan의 공식 표현은 더 정확합니다. 국산 컴퓨트 클러스터, 국산 칩, 그리고 GitHub README의 표현으로는 AI ASIC superpods입니다.

짧은 결론

  • 2026년 7월 6일 기준 LongCat-2.0의 가장 강한 점은 단순히 코드를 쓴다는 사실이 아닙니다. Meituan이 이를 50,000카드 국산 컴퓨트 클러스터에서 전체 학습과 추론을 완료한 조 단위 파라미터 모델로 제시한다는 점입니다.
  • 공개 자료 기준으로 LongCat-2.0은 일반 채팅 우선 제품이 아니라 다음에 분명히 초점을 둡니다.
    1. 긴 컨텍스트
    2. Agentic coding
    3. Tool use와 복잡한 워크플로
    4. 기업급 작업 실행
  • 중국 LLM 인프라, 국산 가속기 학습, coding agent, 기업 AI 워크플로, 긴 컨텍스트 코드 이해에 관심이 있다면 LongCat-2.0은 후보 목록에 넣을 만합니다.
  • 다만 모든 frontier closed-source 모델을 자동으로 대체한다고 보기는 어렵습니다. 실제 워크로드, 지연 시간, 안정성, 총비용에 따라 직접 테스트해야 합니다.

중요한 것은 규모뿐 아니라 풀스택이다

Meituan의 공식 출시 글은 2026년 6월 30일 공개되었습니다. 중요한 이야기는 또 하나의 큰 모델이 아닙니다. 다음 요소들이 함께 묶였다는 점입니다.

  • 총 1.6T 파라미터
  • 평균 약 48B active parameters
  • 33B에서 56B까지의 dynamic activation range
  • native 1M context 지원
  • 50,000카드 국산 컴퓨트 클러스터에서 end-to-end 학습과 추론

이는 매우 다른 신호입니다. 많은 모델 출시는 모델 능력, benchmark 헤드라인, 오픈소스 여부에 집중합니다. LongCat-2.0은 학습 엔지니어링, 추론 엔지니어링, 긴 컨텍스트 아키텍처, agentic coding에 대한 제품 수준 방향을 함께 강조합니다.

국산 인프라 이야기가 어려운 부분이다

핵심 사실 주장부터 보겠습니다.

Meituan 공식 기술 블로그에 따르면 LongCat 팀은 2023년부터 국산 컴퓨트를 탐색했고, 천 카드 규모에서 50,000카드 클러스터로 확장했으며, operator adaptation, communication optimization, distributed stability 문제를 해결하고 국산 컴퓨트에서 조 단위 파라미터 모델의 안정적인 학습과 추론을 완료했습니다.

같은 공개 글에는 몇 가지 엔지니어링 신호도 있습니다.

  • 평균 일일 장애율 70% 이상 감소
  • MFU 1.5x 개선
  • 정상 상태 처리량 1일 1T tokens 초과

모델 시스템을 다루는 사람에게 이런 지표는 창의성 마케팅보다 중요합니다. 대규모 하드웨어 장애, 통신 이상, 메모리 압박, 수치 드리프트, 학습 처리량, 조 단위 MoE 추론의 저지연화 문제를 다루었다는 뜻이기 때문입니다.

LongCat-2.0이 일반 채팅 모델보다 Agentic Coding 모델처럼 보이는 이유

LongCat-2.0 공식 benchmark 차트

제품 프레이밍과 아키텍처 노트 모두에서 LongCat-2.0은 이것저것 조금씩 하는 일반 채팅 어시스턴트처럼 포지셔닝되지 않습니다.

공개 자료가 반복해서 강조하는 것은 다음입니다.

  • 코드 이해
  • 코드 생성
  • 자동 실행
  • tool use
  • 실제 agent workflow

공식 GitHub README는 Claude Code, OpenClaw, Hermes에 깊게 적응되어 있다고도 말합니다.

이 점이 중요합니다. 모델이 일반 지능 이야기만 팔고 싶었다면 agent harness에 이렇게 가까이 묶을 필요가 없습니다. LongCat-2.0은 채팅만 하는 모델이 아니라 실제 개발자 흐름과 agent 실행 루프 안에 들어가려 한다는 신호를 냅니다.

가장 볼 만한 세 가지 기술 아이디어

1. LongCat Sparse Attention

LongCat-2.0은 LongCat Sparse Attention을 강조하며, 긴 컨텍스트 비용을 완전한 이차 비용에서 멀어지게 하는 메커니즘으로 제시합니다.

1M context를 말할 때 진짜 문제는 토큰을 받을 수 있느냐가 아닙니다. 긴 체인에서 안정적인가, 필요한 정보를 계속 찾는가, 추론 비용이 비현실적으로 커지지 않는가가 중요합니다.

agent, 대형 repository, 문서 중심 워크플로에서는 이 부분이 헤드라인보다 중요합니다.

2. Zero-Compute Experts와 Dynamic Activation

공식 activation range는 33B에서 56B, 평균 약 48B입니다.

아이디어는 모든 token에 같은 계산량을 쓰지 않는 것입니다.

  • 쉬운 token에는 덜 쓴다
  • 어려운 token에는 더 쓴다

token 난도가 크게 달라지는 코드와 tool-use 작업에서 특히 관련성이 큽니다.

3. MOPD Multi-Expert Fusion

공식 설명은 세 expert group을 제시합니다.

  • Agent Experts
  • Reasoning Experts
  • Interaction Experts

의미는 분명합니다. 코드 생성만이 아니라 tool calling, reasoning, interaction quality, self-correction까지 포함하려는 모델입니다. 그래서 LongCat-2.0은 고립된 benchmark보다 복잡한 실행 체인에 맞춘 모델처럼 보입니다.

공개 benchmark는 무엇을 말하는가

제가 유용하게 보는 공개 숫자는 보편적 우위를 선언하기 위한 것이 아니라 모델의 형태를 보여주는 것입니다.

  • Terminal-Bench 2.1: 70.8
  • SWE-bench Pro: 59.5
  • SWE-bench Multilingual: 77.3
  • FORTE: 73.2
  • RWSearch: 78.8
  • BrowseComp: 79.9

1. 주로 coding과 agent 모델로 테스트해야 한다

Terminal-Bench 2.1, SWE-bench Pro, SWE-bench Multilingual을 보면 공개 스토리는 명확합니다. LongCat-2.0은 문학적 스타일이나 캐주얼 채팅보다 엔지니어링 작업과 agentic workflow에 초점을 둡니다.

2. 코드 전용은 아니다. 일반 agent 작업도 좁히려 한다

FORTE, RWSearch, BrowseComp 결과는 검색, retrieval, office productivity, multi-step planning에도 노력이 있음을 보여줍니다. 예상 배포 경로는 IDE completion보다 넓으며, 기업 워크플로도 포함합니다.

실제 업무에서는 유용한 파트너인가, 데모 모델인가

Meituan이 benchmark에서 멈추지 않았다는 점은 좋습니다.

공개 공식 작업 예시에는 다음이 포함됩니다.

  • AI SQL agent
  • legacy codebase migration과 plugin refactoring
  • prompt에서 전체 application 생성
  • Three.js 3D interaction 생성
  • 여러 agent로 구성된 AI novel factory

물론 이들은 공식 쇼케이스이며 외부 환경에서 같은 결과를 보장하지 않습니다. 하지만 의도한 사용 패턴은 보여줍니다.

답변만 하는 것이 아니라 이해하고, 계획하고, 생성하고, 실행하고, 전달하는 것.

LongCat-2.0은 소비자용 채팅 어시스턴트보다 개발자와 실행 중심의 agent foundation model에 더 가깝습니다.

“중국 GPU” 서사를 틀리지 않게 쓰는 법

SEO 콘텐츠에서는 이런 표현이 흔히 나옵니다.

  • Chinese GPU-trained LLM
  • domestic GPU large model
  • model trained on Chinese graphics cards

하지만 제가 본 공식 자료 기준으로 더 안전한 표현은 다음입니다.

  • domestic compute cluster
  • domestic chips
  • AI ASIC superpods

이 차이는 중요합니다. GPU라는 단어는 영어 독자에게 소비자 GPU나 일반 GPU 클러스터라는 잘못된 이미지를 줄 수 있습니다. Meituan의 공식 언어는 국산 컴퓨트와 AI ASIC superpods 쪽을 향합니다.

누가 LongCat-2.0을 먼저 테스트해야 하는가

1. Coding agent와 자동 소프트웨어 워크플로를 만드는 팀

  • repository-scale code understanding
  • multi-file edits
  • tool use
  • 자동 실행
  • 긴 프로젝트 컨텍스트
  • 복잡한 chained reasoning

이런 작업을 다룬다면 LongCat-2.0은 일반 채팅 모델이 아니라 agent foundation model 후보로 테스트할 가치가 있습니다.

2. 진지한 중국 국산 모델 경로를 원하는 기업

국산 컴퓨트, 국산 칩, 긴 컨텍스트, 기업 워크플로가 기술 전략이나 조달 논점이라면 LongCat-2.0은 관찰 대상이 아니라 평가 대상입니다.

3. 모델 경제성을 중시하는 API aggregator와 routing 팀

하나의 모델로 모든 작업을 처리하기보다 agentic coding, 검색, 장문, 일반 업무를 routing하는 팀에게 LongCat-2.0은 비교 후보입니다. 테스트할 것은 작업 성공률, 지연 시간, 성공 1회당 비용, 장기 안정성입니다.

최종 의견

LongCat-2.0의 의미는 Meituan이 큰 모델을 냈다는 데 그치지 않습니다.

국산 컴퓨트 인프라, AI ASIC superpods, 1.6T MoE, 1M context, agentic coding을 하나의 공개 스토리로 연결했다는 점입니다.

자동 소프트웨어 워크플로, 긴 코드 이해, tool use, 기업 agent workflow를 다룬다면 LongCat-2.0은 출시 헤드라인이 아니라 실제 작업 세트에 대고 테스트할 모델입니다.

FAQ

Meituan은 LongCat-2.0이 국산 인프라에서 학습과 추론을 모두 완료했다고 명시했나?

네. 2026년 6월 30일 공개된 Meituan 공식 기술 블로그는 LongCat-2.0을 50,000카드 국산 컴퓨트 클러스터에서 전체 학습과 추론을 완료한 조 단위 파라미터 모델로 설명합니다. GitHub README는 built entirely on AI ASIC superpods라는 영어 표현을 사용합니다.

LongCat-2.0은 오픈소스인가?

네. 공식 릴리스는 오픈소스라고 말하며, GitHub repository는 모델 weights가 MIT License로 공개된다고 설명합니다.

LongCat-2.0은 채팅 모델인가, coding과 agent 모델인가?

공개 자료 기준으로는 캐주얼 채팅보다 agentic coding, tool use, 긴 컨텍스트 작업, 복잡한 실행 워크플로에 훨씬 더 명확하게 맞춰져 있습니다.

공식 자료는 GPU, graphics card, ASIC 중 무엇이라고 말하나?

더 정확한 공식 표현은 domestic compute cluster, domestic chips, AI ASIC superpods입니다. 이를 소비자 GPU 이야기로 단순화하지 않는 편이 좋습니다.

References