Perplexity AI, GPU 기반 임베딩 추론 시스템 최적화로 검색 효율성 개선
Perplexity Engineering 팀은 GPU 기반 임베딩 추론 시스템의 최적화 성과를 공개했다. 이 시스템은 AI 검색 제품의 핵심인 벡터 데이터베이스 구축과 쿼리 시점 임베딩 처리의 효율성 및 비용 절감을 목표로 한다. 특히, 대규모 언어 모델(LLM) 스택의 기존 커널을 재활용하고 독자적인 서비스 아키텍처를 도입하여 성능을 향상했다. 핵심 기술 사양 및 아키텍처 Perplexity는 두 가지 주요 임베딩 워크로드(배치 … 더 읽기