Gem Search: X 피드에서 신규 티커와 내러티브를 자동 탐지하는 오픈소스 로컬 분석기
유료 X API 없이 로컬 환경에서 X 피드를 탐색해 신규 토큰 티커, 솔라나 주소, 급부상 내러티브를 추출하고 Grok AI로 검증하는 오픈소스 도구 Gem Search의 아키텍처와 핵심 기능 분석.
소셜 미디어 X(구 트위터) 상에서 급변하는 시장 흐름과 신규 암호화폐 신호를 포착하기 위한 오픈소스 로컬 분석 도구 **Gem Search(gem-search)**가 공개되었습니다. 개발자 @h100envy가 공개한 이 도구는 값비싼 공식 X 개발자 API나 외부 클라우드 인프라에 의존하지 않고, 로컬 머신에서 피드를 직접 스캔해 신규 토큰 티커, 실제 솔라나 공개키 주소, 급부상하는 내러티브 키워드를 추출·정제하는 경량 스파이더 플랫폼입니다. 공개 직후 수 시간 만에 깃허브(GitHub) 스타 100개를 넘어서며 데이터 엔지니어와 온체인 분석가들의 관심을 모으고 있습니다.

이미지 출처: @h100envy on X
기존 소셜 크롤러들이 단순 키워드 검색이나 방대한 텍스트 수집에 그쳐 엄청난 API 비용과 노이즈를 발생시켰던 것과 달리, Gem Search는 로컬 사전 필터링과 암호학적 주소 검증, 그리고 LLM 토큰을 아끼는 엄격한 탑 티어 선별 구조를 전면에 내세웠습니다.
로컬 피드 스파이더와 스마트 티커·솔라나 키 필터링
Gem Search 아키텍처의 출발점은 소셜 피드로부터 유의미한 엔티티를 추출해내는 로컬 스파이더(Spider) 엔진입니다. 외부 유료 API 없이 사용자 환경에서 직접 타임라인을 파싱하는 방식으로 작동합니다.
이 과정에서 쏟아지는 방대한 게시물 데이터 중 시장 분석에 불필요한 노이즈를 걸러내기 위한 다단계 필터링 로직이 작동합니다.
- 메이저 자산 및 가격 표기 자동 제외: 비트코인($BTC), 솔라나($SOL), 스테이블코인($USDC)과 같은 대형 기축 통화와 '$100'처럼 일상적인 가격을 나타내는 숫자 문자열을 자동으로 배제합니다. 이를 통해 시장에 갓 등장한 순수 신규 토큰 티커($TICKER)만을 식별합니다.
- 32바이트 솔라나 주소 암호학적 검증: 단순히 Base58 형태로 구성된 임의의 긴 문자열을 무분별하게 수집하지 않습니다. 추출된 문자열이 실제 유효한 32바이트 암호화 키로 정상 디코딩되는지 로컬에서 직접 검증하여 실제 온체인 솔라나 주소만을 남깁니다.
이러한 정밀 사전 필터링 덕분에 분석 시스템은 스팸 봇이나 의미 없는 숫자 나열에 컴퓨팅 자원을 낭비하지 않고 신뢰도 높은 원시 데이터를 확보할 수 있습니다.
3인 중복 언급 기반 신규 내러티브 탐지와 가속도 산출
단순한 개별 티커 추적을 넘어, 시장 전반의 담론 변화를 감지하는 '신규 내러티브(New Narratives)' 자동 식별 알고리즘도 탑재되었습니다.
특정 키워드가 본격적인 트렌드로 확산되기 이전, 초기 태동 단계에서 나타나는 고유한 소셜 전파 패턴을 포착하도록 설계되었습니다.
- 3인 작성자 중복 언급 규칙: 최근 6시간 동안 상호 독립된 3명 이상의 상이한 계정이 동일한 단어 쌍(word pairs)을 반복해서 언급할 경우 이를 잠재적 신규 내러티브 후보로 포착합니다.
- 기존 토픽 필터링: 이미 널리 알려진 기존 주제 목록에 포함되지 않은 완전히 새로운 어휘 조합만을 선별하여, 이미 시장에 퍼진 진부한 이슈가 아닌 미지의 테마를 선제적으로 발굴합니다.
- 모멘텀 성장 가속도 계산: 발견된 모든 신호에 대해 직전 6시간 동안의 언급 횟수와 이전 18시간 동안의 언급 횟수를 비교 분석합니다. 여기에 최초 감지 시점(first signal time)과 고유 작성자 수를 결합하여 해당 키워드가 얼마나 가파른 속도로 성장하고 있는지를 정량 지표로 제시합니다.
Grok API 최적화와 연구 전용 런칭 방지 가드레일
추출된 소셜 데이터의 최종 맥락 검증에는 xAI의 Grok AI가 활용됩니다. 하지만 모든 텍스트를 무차별적으로 LLM에 전달하는 대신, 철저한 쿼터 보호 아키텍처를 적용했습니다.
- 패스당 상위 후보 선별 유지: 스파이더가 수집한 결과 중 한 번의 패스(pass)당 상위 10개 티커, 10개 솔라나 주소, 5개 핵심 문구만을 최종 유지합니다. 이를 통해 정제되지 않은 쓰레기 데이터를 차단하고 가장 유망한 신호에만 Grok API 호출을 집중해 비용과 토큰 한도를 최적화합니다.
- topics.json 커스텀 감시 목록: 사용자는 자체 감시 목록 설정 파일인
topics.json을 통해 자신이 추적하고자 하는 관심 분야와 키워드를 맞춤형으로 정의할 수 있습니다. - 연구 전용(Research Only) 보호 장치: 탐지된 티커, 지갑 주소, 문구에는 기본적으로 '연구 전용(research only)' 마킹이 강제됩니다. 분석 결과가 토큰 자동 생성이나 런칭 대기열로 직접 연결되지 않도록 격리하여, 타인의 프로젝트나 토큰을 실수로 복제 발행하는 사고를 방지하는 안전 가드레일을 제공합니다.
오픈소스 인텔리전스 활용성과 로컬 스크래핑 한계
Gem Search는 데이터 엔지니어링 관점에서 유료 상용 API의 비용 장벽을 우회하면서도, 규칙 기반 필터링과 소형 LLM 검증을 결합해 소셜 인텔리전스를 구축하는 실용적인 접근법을 보여줍니다.
다만 실제 환경에서 도구를 운용할 때 고려해야 할 기술적 제약과 환경적 주의점도 존재합니다.
- 공식 API 미사용에 따른 유지보수 부채: 공식 X API 대신 웹 타임라인을 직접 파싱하는 구조이므로, X 측의 HTML 구조 변경, 스크래핑 방지 정책, 레이트 리밋 및 IP 차단 등 플랫폼 환경 변화에 취약할 수 있습니다.
- 토큰 프로모션과 코드 아키텍처의 분리 평가: 개발자가 프로젝트 소개 과정에서 자체 밈코인($GEMSEARCH) 언급을 병행하고 있으므로, 투자나 투기 목적이 아닌 로컬 피드 파싱, 단어 쌍 추출 알고리즘, LLM 호출 최적화 등의 소프트웨어 엔지니어링 관점에서 코드를 검토하는 접근이 필요합니다.
Gem Search는 소셜 미디어의 방대한 텍스트 스트림을 로컬 환경에서 경제적으로 구조화하고 필터링하려는 개발자들에게 참고할 만한 아키텍처 참조 모델을 제시합니다.
출처
- GitHub 리포지토리: h100envy/gem-search
- h100envy 공식 X (@h100envy): Gem Search 공개 발표 게시물