콘텐츠 내 자동삽입광고

광고1

posted by 초코생크림빵 2026. 9. 10. 07:37
반응형

AGI와 프로젝트 아스트라(Project Astra)는 각각 범용 인공지능과 구글의 차세대 멀티모달 AI 프로젝트를 의미합니다.

 

약어 풀네임

  • AGI: Artificial General Intelligence (범용 인공지능)
  • Astra: 특정 약어가 아닌, 라틴어로 "별"을 뜻하는 구글의 AI 프로젝트 명칭 (Project Astra)

정의

  • AGI (범용 인공지능): 특정 영역(바둑, 번역 등)만 잘하는 기존 AI(특화형 AI)와 달리, 인간처럼 다양한 영역의 지식을 스스로 학습하고 추론하며 문제 해결할 수 있는 만능 AI를 뜻합니다.
  • 프로젝트 아스트라 (Project Astra): 구글 딥마인드가 개발한 실시간 범용 비전·음성 AI 에이전트입니다. 스마트폰 카메라나 스마트 글래스를 통해 AI가 눈으로 세상을 실시간 인식하고, 사용자와 자연스럽게 대화하며 도울 수 있도록 설계되었습니다.

 

 

실사용 사례

  • 잃어버린 물건 찾기: 카메라로 방 안을 비추며 다니면, 아스트라가 방 내부를 기억해 두었다가 "내 안경 어디 뒀지?"라고 물었을 때 "아까 서랍 옆 빨간 컵 뒤에 두셨어요"라고 즉시 안내합니다.
  • 실시간 복잡한 코드·도면 해석: 모니터의 복잡한 프로그래밍 코드를 카메라로 비추면, 문제점이 있는 위치를 실시간으로 찾아내어 말로 설명해 줍니다.
  • 현장 사물·시스템 즉시 설명: 도로 위의 특정 장비나 시스템을 비추며 "이 부품이 무슨 역할을 해?"라고 물으면 멈춤 없이 즉각 작동 원리를 대화로 풀어 설명합니다.

참고-용어 설명)

  • 범용 비전 (Vision): '비전'은 카메라를 통해 AI가 눈으로 보는 기능을 뜻합니다. 단순히 글자나 얼굴만 인식하는 수준을 넘어, 사람처럼 주변 환경·물체·동영상 등 화면에 찍히는 모든 시각 정보를 종합적으로 이해할 수 있다는 의미에서 '범용'이라는 표현을 씁니다.
  • 음성 AI 에이전트 (Agent): '에이전트'는 말씀하신 대로 사람을 대신해 업무를 처리해 주는 대리인(비서)을 뜻합니다. 텍스트를 입력할 필요 없이 사람처럼 음성으로 자연스럽게 대화하며 사용자의 요청을 처리해 주는 인공지능 비서입니다.

쉽게 한 문장으로 정리하면

"컴퓨터 화면이나 카메라로 세상을 직접 보면서, 사람처럼 말로 주고받으며 일을 도와주는 똑똑한 인공지능 비서"입니다.

 

기존 AI 비서와의 차이점

구분 기존 AI 비서 (시리, 아리 등) 실시간 비전·음성 AI 에이전트
인식 방식 음성 명령 입력만 인식 카메라 시각 + 음성 동시에 인식
반응 속도 대화 시 약간의 딜레이 발생 사람과 대화하듯 실시간 대응
상황 이해 "오늘 날씨 어때?" 같은 단답형 "내가 지금 보고 있는 이 코드 에러 좀 찾아줘" 같은 복잡한 맥락 이해

 

카메라로 화면이나 주변을 비추기만 하면, 별도의 설명 없이도 AI가 상황을 '보고 이해한 상태'에서 음성으로 바로 도움을 줄 수 있는 것이 핵심입니다.

 

추가설명)   음성·시각 인식을 넘어 상황을 판단하고 행동하는 'AI 에이전트'의 작동 구조

스스로 판단하고 작업을 수행하는 AI 에이전트는 인간이 감각을 통해 정보를 받아들이고 뇌로 생각한 뒤 몸을 움직여 행동하는 방식과 동일한 구조로 작동합니다.

AI 에이전트의 내부 구조는 크게 4가지 핵심 모듈로 구성됩니다.

AI 에이전트의 4대 핵심 구조

  • 감각 모듈 (Perception / Inputs): 인간의 눈과 귀 역할을 합니다. 카메라(시각), 마이크(음성), 센서, 웹 데이터, 문서 파일 등 외부 세상의 데이터를 실시간으로 받아들여 디지털 데이터로 변환합니다.
  • 뇌·지능 모듈 (Brain / LLM & Multi-Modal): 에이전트의 중심부입니다. 대형 언어 모델(LLM)이나 멀티모달 모델이 탑재되어 입력받은 상황을 해석하고, 사용자의 목표를 달성하기 위한 추론(Reasoning)과 계획 수립(Planning)을 진행합니다.
  • 기억 모듈 (Memory): 단기 기억(현재 진행 중인 대화나 작업 맥락)과 장기 기억(과거 사용자의 취향, 이전 작업 결과, 외부 DB)으로 나뉩니다. 필요한 순간 과거 데이터를 불러와 맥락을 유지하고 일관된 판단을 내리게 돕습니다.
  • 행동 모듈 (Action / Tools & Actuators): 판단된 결과를 바탕으로 실행에 옮기는 손과 발 역할입니다. API 호출, 프로그램 클릭, 데이터베이스 조회, 메일 발송, 로봇 팔 제어 등 실제 작업을 수행합니다.

실제 작동 원리 (4단계 프로세스)

 

  • 상황 인식 및 목표 수립: 사용자가 "다음 주 출장 일정에 맞춰 KTX 예매하고 관련 자료 요약해 줘"라고 요청하면, 감각 모듈이 음성과 캘린더 화면을 받아들여 최종 목표를 설정합니다.
  • 작업 분하 (Planning): 뇌 모듈이 복잡한 목표를 소작업으로 쪼갭니다.
    • 1단계: 캘린더에서 출장 날짜와 시간 확인
    • 2단계: KTX 앱 접속 및 최적의 시간대 열차 검색
    • 3단계: 출장 관련 문서 로드 및 요약본 작성
  • 도구 선택 및 실행 (Action & Tools): 기억 모듈에서 기존 선호 좌석 데이터를 불러온 뒤, API와 자동화 도구를 사용해 열차를 예약하고 요약 문서를 생성합니다.

결과 평가 및 피드백 (Feedback Loop): 실행 중 오류(예: 원하는 시간대 좌석 품절)가 발생하면 스스로 다른 대안 시간대를 찾아 수정한 뒤, 최종 완료 내역을 사용자에게 음성이나 화면으로 보고합니다.

 

반응형

콘텐츠 내 자동삽입광고