NexusAi logo

NexusAi

  • 제품
  • 카테고리
  • 프롬프트
  • 검색
  • 인사이트
  • 요금제
  • 프로모션
  • 문의
로그인
NexusAi LogoNexusAi

NexusAi는 AI 도구를 쉽게 발견하고 비교하며 학습할 수 있도록 돕습니다. 전문가 인사이트부터 트레이닝 리소스까지 제공하여 개인과 기업이 AI를 활용해 더 스마트한 의사결정, 혁신, 성장을 이루도록 지원합니다.

유용한 링크

  • 회사 소개
  • AI 제품
  • AI 카테고리
  • AI 프롬프트
  • AI 검색
  • AI 인사이트

서비스 및 약관

  • 홍보 및 프로모션
  • 멤버십 플랜
  • 이용약관
  • 환불 정책
  • 개인정보 처리방침
  • 면책 조항

문의하기

88 Tribune Street
South Brisbane, QLD, Australia, 4101
공식 웹사이트: www.nexusai-tech.com
이메일: info@nexusai-tech.com

© 저작권 2026 NexusAi 모든 권리 보유

디자인 및 개발 DStudio Technology
홈/AI 인사이트/AI 제품 뉴스/Cisco와 NVIDIA, 실시간 토크노믹스와 가드레일을 갖춘 온프레미스 AI 에이전트를 Splunk에 도입
AI 제품 뉴스에이전트 인프라

Cisco와 NVIDIA, 실시간 토크노믹스와 가드레일을 갖춘 온프레미스 AI 에이전트를 Splunk에 도입

Cisco는 NVIDIA 가속화가 적용된 사전 검증된 AI POD와 Splunk Agent Observability의 실시간 토크노믹스를 통해 에이전트형 AI를 Splunk 환경에 직접 도입합니다. 기업은 이제 민감한 로그를 클라우드로 이동하지 않고도 기계 데이터 옆에서 AI를 실행, 보안 및 비용 관리할 수 있습니다.

NexusAI 편집부2026년 9월 16일2.5K 회7 분 소요
Cisco와 NVIDIA, 실시간 토크노믹스와 가드레일을 갖춘 온프레미스 AI 에이전트를 Splunk에 도입
AI 브리프

Cisco는 NVIDIA 가속 인프라에서 사전 검증된 Splunk용 AI POD를 제공해 기업 기계 데이터가 이미 존재하는 곳에 에이전트형 AI를 밀어넣고 있습니다. 이는 로그를 클라우드로 전송할 수 없지만 엄격한 거버넌스 하에 에이전트 워크플로우와 LLM 선택을 원하는 보안 민감 팀에 중요합니다. Splunk Agent Observability의 토크노믹스 기능은 에이전트와 코딩 도구 전반의 토큰 사용, 비용 귀속, 소모율 예측을 하나의 창에서 제공합니다. 실용적 결론은 온프레미스 에이전트 계층을 표준화하고, 목적에 맞는 모델을 선택하며, 확장 전에 비용과 안전 제어를 시행해 파일럿을 관리되고 측정 가능한 프로덕션으로 전환할 수 있다는 점입니다.

Splunk에서 텔레메트리를 중앙 집중화하는 기업들은 오랫동안 주권과 보안을 위해 데이터를 온프레미스에 유지할지, 최신 AI 에이전트에 접근하기 위해 클라우드로 이동할지의 딜레마에 직면해 왔습니다. NVIDIA 가속 컴퓨팅과 쿠버네티스 런타임 기반으로 구축된 Cisco의 새로운 Splunk용 AI POD는 이 간극을 해소합니다. 팀은 로그와 메트릭 옆에서 Splunk AI 어시스턴트와 신흥 에이전트 런치패드를 실행하면서 오픈 및 독점 모델을 혼합해 자체 호스팅할 수 있습니다. 사전 검증된 스택은 통합 위험과 가치 실현 시간을 줄여 운영 및 보안 팀에 기존 관측 환경과 동일한 제어로 강화할 수 있는 에이전트 기반을 제공합니다.

주목할 만한 운영 변화는 비용 및 행동 가시성입니다. Splunk Agent Observability의 토크노믹스 기능은 Claude Code, Codex, Cursor와 같은 코딩 에이전트를 포함해 에이전트, 사용자, 워크플로우별 토큰 사용량을 추적해 리더들이 채택을 가치에 연결할 수 있게 합니다. 시계열 모델링으로 소비를 예측하고, 무한 루프에 대해 경고하며, 비용을 사업부에 귀속시킵니다. 동일 플랫폼이 프롬프트, 응답, 도구 호출을 검사하므로 팀은 런타임 가드레일을 적용해 위험한 행동을 차단하고 환각 현상을 억제할 수 있습니다. 실제로 예산 설정, 실시간 과다 사용 방지, 단위 경제학으로 ROI 입증이 가능해져 월말의 놀라움을 줄입니다.

전략적으로 이 아키텍처는 파일럿에서 관리되는 에이전트 패브릭으로의 전환을 가속화합니다. 모델 실행을 데이터 근처로 가져옴으로써 기업은 취약한 ETL 경로를 피하고 데이터 유출 위험을 줄입니다. 모델 선택은 유연하게 유지됩니다: 팀은 NVIDIA의 Nemotron 계열과 같은 오픈 웨이트 옵션을 Cisco의 Deep Time Series Model과 같은 도메인 특화 모델과 함께 실행할 수 있습니다. 대가는 운영 성숙도입니다—쿠버네티스, GPU 스케줄링, 모델 평가, 프롬프트 위험 관리를 일급 과제로 다뤄야 합니다. 구매자 입장에서는 “여기에 AI를 사용할 수 있나?”에서 “어떤 에이전트가 어떤 하드웨어와 가드레일 하에서 가치를 창출하는가?”로 질문이 바뀝니다. 정확히 답하는 조직이 더 적은 재작성으로 더 빠르게 확장할 것입니다.

핵심 요약

데이터 근처에 에이전트 배치

NVIDIA 가속과 쿠버네티스 관리가 적용된 Cisco AI POD에서 Splunk 네이티브 에이전트를 실행하면 데이터 이동을 피하고 배포를 단축하며 관측 환경 내 거버넌스를 유지할 수 있습니다.

토크노믹스 운영화

에이전트와 팀별 토큰을 추적하고, 소모를 예측하며, 예산을 설정하고, 가드레일을 적용해 비용 폭주를 막으세요. 이후 비용을 MTTR, 알림 감소, 분석가 지원률과 연결하세요.

하이브리드 선택 설계

라우팅에는 작은 모델을, 추론에는 큰 모델을 사용하세요. GPU를 분할하고, 작업별 평가가 포함된 모델 레지스트리를 유지하며, 사고 급증에 대비해 하이브리드 용량을 계획하세요.

변화된 점: Splunk를 위한 온프레미스 에이전트 계층

Cisco의 Splunk용 AI POD는 Cisco 인프라를 NVIDIA 가속 컴퓨팅 및 쿠버네티스 오케스트레이션과 결합한 패키지 런타임을 추가하여 Splunk AI 워크로드에 최적화했습니다. 현재 Splunk AI 어시스턴트와 곧 출시될 에이전트 런치패드는 이 계층 위에서 실행되어 팀이 텔레메트리를 온프레미스에 유지하면서 조사, 쿼리 작성, 맞춤 에이전트 구축을 할 수 있습니다. 사전 검증된 덕분에 고객은 GPU 프로필, 저장소 처리량, 네트워크 분할에 대한 권장 기본값을 받아 예측 가능한 지연 시간과 사고 대응에 필수적인 환경을 확보합니다. 결과적으로 배포 주기가 짧아지고, 일회성 통합이 줄며, 보안 팀이 다른 규제 워크로드처럼 검토 및 강화할 수 있는 청사진을 제공합니다.

토크노믹스와 제어: 추측에서 예산 규율로

Splunk Agent Observability는 프롬프트, 도구 호출, 지연 시간, 실패 모드, 토큰 등 에이전트와 모델을 종단 간으로 계측합니다. 팀은 에이전트, 팀, 프로젝트별로 비용을 귀속시키고, 속도 제한을 적용하며, 기간 중 소모 곡선을 예측할 수 있습니다. 이는 전형적인 ‘청구서 충격’ 문제를 해소하고 비용 청구 또는 비용 공유의 기반을 마련합니다. 가드레일이 인라인에 위치해 위험한 행동을 차단하고 컨텍스트 창을 제한하며 도구를 샌드박스할 수 있습니다. 성능 KPI(해결 시간, 오탐 감소, 분석가 지원률)와 결합해 리더십은 어떤 에이전트가 더 많은 GPU 예산을 받아야 하는지, 어떤 에이전트가 리팩토링, 더 작은 모델, 검색 개선이 필요한지 명확히 파악할 수 있습니다.

아키텍처 선택: 모델, GPU, 쿠버네티스

모든 워크플로우에 700억 파라미터 모델이 필요한 것은 아닙니다. 라우팅, 도구 선택, 템플릿 응답에는 작고 빠른 오픈 웨이트를 사용하고, 추론이 많은 조사에는 더 큰 모델을 예약하세요. VRAM은 컨텍스트 창과 동시성에 맞게 조정하고, MIG 또는 GPU 파티션을 사용해 워크로드를 격리하고 지연 시간 SLO를 보호하세요. 쿠버네티스는 제어 평면 역할을 하며, 큐 깊이에 따라 자동 확장하고, 네임스페이스별 GPU 유형을 고정하며, 개발/테스트와 프로덕션 클러스터를 분리합니다. Splunk 데이터 슬라이스에 연결된 평가가 포함된 모델 레지스트리를 추가해 교체를 증거 기반으로 만드세요. 이는 비용 예측 가능성을 유지하면서 Nemotron급 또는 도메인 모델을 새로운 사용 사례에 맞춰 추가할 수 있는 옵션을 보존합니다.

구매자 가이드: 30-60-90일 롤아웃

0~30일: 프로덕션 인접 사용 사례 두 가지(예: 알림 분류 및 쿼리 초안)를 정의하세요. 비용과 MTTR을 기준선으로 설정하고 AI POD 참조 설정을 배포하며 팀별 비용 센터와 가드레일 기본값으로 토크노믹스를 계측하세요. 31~60일: 모델 레지스트리를 구축하고 소형 및 중형 모델을 추가하며 실제 티켓으로 A/B 테스트를 진행하세요. 컨텍스트 제한을 적용하고 경량 분류기로 라우팅하며 공유 프롬프트를 게시하세요. 61~90일: 비용 청구/공유를 활성화하고 에이전트별 SLO(지연, 정확도, 비용/사고)를 추가하며 별도 예산으로 코딩 에이전트를 확장하세요. 그 후에야 SOC 또는 NOC에서 자율 플레이북으로 범위를 넓히세요.

위험과 한계: 온프레미스가 느려질 때

온프레미스 제어는 데이터 유출과 거버넌스 위험을 줄이지만 복잡성을 팀에 전가합니다. 부족한 GPU나 I/O 병목은 동시성이 급증할 때 에이전트를 지연시킵니다. 레지스트리와 평가 규율 없는 모델 확산은 비용 예측 불가능과 편차를 초래합니다. GPU를 희소하고 예약된 자원으로 취급하고, 라우팅 정책을 문서화하며, 프롬프트 위생을 강제하고, 검색 커넥터를 사전 승인하세요. 버스트 용량에 대해 현실적으로 접근하고, 오버플로우나 저위험 워크로드에 하이브리드 아키텍처를 고려하세요. 마지막으로 초기부터 레드팀과 감사 추적에 투자해 모든 에이전트 행동을 자신 있게 설명하고 필요 시 롤백할 수 있도록 하세요.

자주 묻는 질문

초기 Splunk 에이전트 워크로드에 적합한 하드웨어 크기는 어떻게 산정하나요?

사고당 토큰과 동시 조사 수를 추정한 후 VRAM과 처리량을 역산하세요. 격리를 위해 MIG 또는 GPU 파티셔닝으로 시작하고, 컨텍스트 창을 제한하며, 큐 깊이에 따라 확장하세요. 지연 시간을 SLO 이하로 유지하려면 소형/중형 모델 조합을 사용하고, 복잡한 추론 경로에는 더 큰 모델을 예약하세요.

자율 행동을 활성화하기 전에 필수적인 거버넌스 제어는 무엇인가요?

에이전트 및 도구 수준의 RBAC, 데이터 유출 및 위험 행동에 대한 런타임 가드레일, 프롬프트 및 출력 로깅, 작업별 평가가 포함된 모델 레지스트리를 구현하세요. 모델 교체 시 변경 승인을 요구하고, 토크노믹스를 통해 예산 한도를 강제하며, 영향력 큰 플레이북에는 인간 개입을 추가하세요.

순수 토큰 사용량을 넘어 ROI는 어떻게 측정하나요?

해결된 사고당 비용, MTTR 변화, 분석가 지원률, 오탐 감소, 클라우드 데이터 유출 회피를 추적하세요. 비용을 사업부에 귀속시키고 배포 전 기준선과 비교하세요. 예산 내에서 속도와 정확도에서 지속적인 개선을 보인 에이전트를 우대하세요.

#에이전트용 관측성#에이전틱 관측#토큰 비용 관리#에이전트 비용 원격 측정#에이전트 사용 대시보드#에이전틱 비용 최적화#비용 및 타임아웃 관리#시계열 기초 모델#셀프 호스팅 AI 에이전트#데이터 주권#오픈 가중치 모델#네모트론 모델#엔터프라이즈 쿠버네티스#엔터프라이즈 에이전트 거버넌스#런타임 정책 집행#엔터프라이즈 에이전트 보안#휴먼 인 더 루프 제어#다중 공급업체 LLM 전략#기업용 코딩 도우미#에이전틱 SOC#토크노믹스#스플렁크 에이전트 관측#시스코 AI POD#안전한 AI 공장#온프레미스 AI#AI 비용 관리#엔비디아 네모트론#쿠버네티스 AI 운영#GPU 관측성#모델 레지스트리

AI 인사이트 뉴스레터

최신 AI 업데이트, 툴 뉴스 및 인사이트를 받은편지함으로 받아보세요.

스팸은 없습니다. 언제든지 구독을 취소하실 수 있습니다.
이 페이지의 내용
1.변화된 점: Splunk를 위한 온프레미스 에이전트 계층2.토크노믹스와 제어: 추측에서 예산 규율로3.아키텍처 선택: 모델, GPU, 쿠버네티스4.구매자 가이드: 30-60-90일 롤아웃5.위험과 한계: 온프레미스가 느려질 때
이 기사 공유하기

관련 기사

Anthropic과 Accenture, 독립적인 최첨단 AI 평가에 20억 달러 투자 — 다섯 번째 계층의 등장
일반 AI 업계 뉴스

Anthropic과 Accenture, 독립적인 최첨단 AI 평가에 20억 달러 투자 — 다섯 번째 계층의 등장

2026년 9월 19일

WSO2, 에이전트 매니저 오픈: 기업 에이전트 확산을 위한 아이덴티티 우선 거버넌스
일반 AI 업계 뉴스

WSO2, 에이전트 매니저 오픈: 기업 에이전트 확산을 위한 아이덴티티 우선 거버넌스

2026년 9월 17일

NVIDIA의 2GW 호주 프로젝트, AI 공장을 주권 자산 클래스로 전환
일반 AI 업계 뉴스

NVIDIA의 2GW 호주 프로젝트, AI 공장을 주권 자산 클래스로 전환

2026년 9월 11일

NeoMME 260M, 검색을 최우선으로: 페이지 처리량을 두 배로 늘린 단일 트랜스포머 멀티모달 인코더
AI 제품 뉴스

NeoMME 260M, 검색을 최우선으로: 페이지 처리량을 두 배로 늘린 단일 트랜스포머 멀티모달 인코더

2026년 9월 4일

Claude Fable 5.1, Opus 5를 제치고 에이전트 벤치마크 1위—작업당 비용 절감도 실현
AI 모델 및 플랫폼 업데이트

Claude Fable 5.1, Opus 5를 제치고 에이전트 벤치마크 1위—작업당 비용 절감도 실현

2026년 9월 3일

관련 AI 툴

전체 보기
Cisco Cloud Control: AI 준비 네트워킹, 보안 및 운영 플랫폼

Cisco Cloud Control: AI 준비 네트워킹, 보안 및 운영 플랫폼

AI 인프라 및 하드웨어

NVIDIA: 가속 컴퓨팅, AI 인프라 및 피지컬 AI 플랫폼

NVIDIA: 가속 컴퓨팅, AI 인프라 및 피지컬 AI 플랫폼

개발 & 코딩 AI