NVIDIA G-Assist no es solo un chatbot: cómo funcionan realmente su SLM local, sus herramientas, sus complementos y MCP

NVIDIA Project G-Assist parece un chatbot, pero su arquitectura real se acerca más a la de un agente de IA local. Un modelo de lenguaje pequeño interpreta tu solicitud, el estado del sistema proporciona información actual del PC, las herramientas realizan acciones reales y los complementos amplían aquello que el asistente tiene permitido controlar.
Publicado:
Aleksandar Stajic
Updated: 26 de septiembre de 2026 a las 09:34
NVIDIA G-Assist no es solo un chatbot: cómo funcionan realmente su SLM local, sus herramientas, sus complementos y MCP

NVIDIA Project G-Assist parece un chatbot, pero esa descripción omite la parte importante. Es un sistema de IA local que puede entender una solicitud, inspeccionar el estado compatible del PC, elegir una herramienta o complemento y luego realizar una acción real, como cambiar la configuración de DLSS, verificar un controlador, ajustar un perfil de ventilador o controlar un periférico.

Primero: ¿qué hace realmente el modelo de IA?

G-Assist utiliza un modelo de lenguaje pequeño local, o SLM. NVIDIA describe actualmente el sistema como el uso de un modelo instruct basado en Llama de 8 mil millones de parámetros.

El trabajo principal del modelo no es renderizar gráficos ni cambiar directamente registros de hardware. Su trabajo es entender el lenguaje del usuario, decidir qué capacidad compatible coincide con la solicitud y preparar la llamada a esa capacidad.

Por ejemplo, si dices “configura DLSS Super Resolution en modo Rendimiento”, el modelo de lenguaje no modifica DLSS por sí mismo. Interpreta el comando y lo dirige a la función compatible que puede cambiar la configuración.

El flujo de acción de G-Assist

Qué sucede después de darle un comando a G-Assist

1
1. Das una solicitud en lenguaje natural
Por ejemplo: “Optimiza este juego para rendimiento”.
2
2. El SLM local interpreta la solicitud
Determina la intención del usuario e identifica qué función o complemento compatible es relevante.
3
3. El sistema elige una herramienta
Podría ser una función integrada de configuración gráfica, verificación de controladores, función de monitoreo o complemento de la comunidad.
4
4. Se extraen los argumentos
El modelo convierte la solicitud en valores estructurados como nombre del juego, modo, perfil de ventilador o configuración de DLSS.
5
5. La herramienta se ejecuta
La herramienta se comunica con la NVIDIA App, el sistema operativo, el software del periférico u otro servicio.
6
6. Se devuelve el resultado
G-Assist informa lo que sucedió o devuelve datos que el modelo puede explicar.

Esto es llamada a herramientas, no control mágico del PC

Un modelo de lenguaje no puede controlar de forma segura una computadora arbitraria simplemente porque entiende inglés.

Necesita una interfaz definida que indique qué acciones existen, qué argumentos aceptan y qué devuelve la herramienta.

Las capacidades integradas actuales de G-Assist incluyen funciones como optimizar la configuración gráfica, cambiar opciones RTX compatibles, verificar o descargar controladores, mostrar información de rendimiento, cambiar algunas funciones de energía del portátil, controlar funciones de monitor compatibles y usar complementos de periféricos compatibles.

Modelo de lenguaje vs herramienta

Modelo de lenguajeHerramienta / complemento
Entender “activar DLSS”
Elegir la función correcta
Cambiar realmente la configuración
Explicar el resultado

¿Qué es la capa de conocimiento?

G-Assist también tiene una capa de conocimiento para responder preguntas y hacer recomendaciones.

NVIDIA dice que la versión 0.2.1 introdujo un sistema de conocimiento mejorado que ayuda a G-Assist a hacer recomendaciones de configuración más precisas.

Esa capa de conocimiento es diferente del estado en vivo de tu PC.

Conocimiento vs estado en vivo de la PC

ConocimientoEstado en vivo
GPU
Configuración del juego
Rendimiento

¿G-Assist usa RAG?

La respuesta más segura es: G-Assist claramente tiene un sistema de conocimiento, pero la página pública del producto de NVIDIA no documenta cada mecanismo interno de recuperación con suficiente detalle como para afirmar que cada respuesta de conocimiento es producida específicamente por RAG.

La distinción arquitectónica sigue siendo importante. Una capa de recuperación puede proporcionar conocimiento relevante, mientras que las herramientas del sistema proporcionan el estado actual de la PC y realizan acciones.

Esa es la misma separación que se usa en muchos agentes modernos: el conocimiento es una fuente de contexto, las observaciones en vivo son otra, y la ejecución de herramientas es una tercera.

Por qué G-Assist puede funcionar sin conexión

NVIDIA ejecuta el modelo de lenguaje localmente en la GPU GeForce RTX.

Eso significa que el asistente principal no requiere un modelo de lenguaje alojado en la nube para cada indicación.

NVIDIA dice explícitamente que G-Assist puede funcionar sin conexión para sus capacidades locales.

Un complemento aún puede usar internet si ese complemento llama a un servicio en línea. La ejecución local del modelo y el acceso en línea de los complementos son cuestiones separadas.

El costo de la IA local: G-Assist usa tu GPU y VRAM

Ejecutarse localmente brinda privacidad e independencia de un modelo en la nube, pero el trabajo tiene que ejecutarse en algún lugar.

Para G-Assist, ese algún lugar es la misma GPU GeForce RTX que ya podría estar renderizando tu juego.

NVIDIA advierte que la GPU asigna brevemente recursos de cómputo a la inferencia de IA cuando G-Assist responde. Si se está ejecutando un juego exigente al mismo tiempo, el juego puede perder temporalmente algo de rendimiento de renderizado mientras el modelo está activo.

Los requisitos actuales también especifican objetivos de VRAM libre más allá de la memoria ya utilizada por el juego: aproximadamente 6 GB de VRAM libre para el Modo Razonamiento y 4,5 GB para el Modo Flash.

Modo Razonamiento vs Modo Flash

Las versiones actuales de G-Assist separan un Modo Razonamiento más capaz de un Modo Flash más rápido.

El Modo Razonamiento está diseñado para decisiones de mayor calidad y puede coordinar múltiples acciones desde un solo prompt. El Modo Flash está optimizado para respuestas más rápidas y una menor demanda de recursos.

Modo Razonamiento vs Modo Flash

Modo RazonamientoModo Flash
Objetivo principal
VRAM libre recomendada
Mejor para

Qué añaden realmente los complementos

Un complemento no reemplaza al modelo de lenguaje. Le da al modelo una nueva acción que puede invocar.

El complemento define funciones, descripciones y parámetros. G-Assist lee esas descripciones, asocia una solicitud del usuario con la función adecuada y le envía argumentos estructurados.

Eso permite que el asistente crezca más allá de las funciones integradas de NVIDIA.

Cómo funciona un complemento de G-Assist

1
1. El complemento declara una función
Por ejemplo: set_keyboard_color(color).
2
2. El manifiesto describe la función
El manifiesto le indica a G-Assist qué hace la función y qué parámetros necesita.
3
3. El usuario pregunta de forma natural
Por ejemplo: “Pon mi teclado en verde.”
4
4. El SLM selecciona la función
El modelo asigna la solicitud a la función del complemento y extrae verde como parámetro.
5
5. El complemento se ejecuta
El complemento se comunica con el software del periférico o el servicio externo.

El Protocolo V2 de G-Assist es JSON-RPC 2.0

El repositorio público actual de complementos de NVIDIA utiliza el Protocolo V2.

El Protocolo V2 utiliza JSON-RPC 2.0 con mensajes con prefijo de longitud entre el motor de G-Assist y los complementos.

El motor puede inicializar un complemento, verificar su estado, ejecutar una función, enviar entrada del usuario y apagarlo. Los complementos pueden devolver resultados, transmitir progreso o informar errores.

Los mensajes importantes del Protocolo V2

DirecciónPropósito
initialize
ping
execute
stream
complete

Dónde entra en escena MCP

El propio protocolo de complementos de G-Assist no es MCP. Su sistema actual de complementos públicos utiliza JSON-RPC 2.0.

Sin embargo, un complemento de G-Assist puede conectarse a un servidor MCP.

La versión actual 0.2.2 de NVIDIA incluye una integración con Elgato que puede invocar acciones expuestas a través del servidor MCP de Elgato Stream Deck.

Por qué esto importa más allá de las luces RGB

La arquitectura de complementos convierte a G-Assist de un asistente fijo en un enrutador de herramientas local.

El mismo patrón puede conectar un SLM a herramientas de monitoreo, periféricos, API, sistemas de automatización, aplicaciones locales o servicios externos.

La unidad arquitectónica importante, por lo tanto, no es la ventana de chat. Es el límite entre la intención en lenguaje natural y la ejecución estructurada de herramientas.

El stack de agente local

Una forma útil de pensar en G-Assist

1
1. Intención del usuario
Comando de lenguaje natural o voz.
2
2. SLM local
Comprende la solicitud y elige una capacidad.
3
3. Conocimiento / contexto
Proporciona conocimiento del producto, recomendaciones o información necesaria para la decisión.
4
4. Estado del sistema en vivo
Proporciona información actual de hardware, controladores, rendimiento o configuración cuando es compatible.
5
5. Selección de herramienta
Se elige una función integrada o un complemento.
6
6. Ejecución estructurada
La función recibe argumentos y realiza la acción real.
7
7. Verificación del resultado
La herramienta devuelve estado o datos y el modelo explica lo que sucedió.

Por qué los límites de las herramientas son una característica de seguridad

Un asistente de IA que pudiera ejecutar comandos arbitrarios del sistema operativo sería mucho más poderoso, pero también mucho más difícil de restringir.

G-Assist, en cambio, expone funciones definidas con parámetros conocidos.

Eso significa que el modelo solo puede realizar acciones que el conjunto de funciones integradas o los complementos instalados pongan a disposición.

Esto no elimina todos los riesgos, especialmente con complementos de terceros, pero crea un límite de permisos y capacidades más claro que el acceso irrestricto al shell.

El límite de autoridad de las herramientas

Lo que el asistente puede entender vs lo que se le permite hacer

El modelo puede entenderAutoridad de la herramienta
Ajuste de GPU
Archivos
Internet
Control de periféricos

Por qué G-Assist puede reducir temporalmente el rendimiento del juego

La arquitectura de modelo local tiene una consecuencia directa: la IA y el juego pueden competir por la misma GPU.

NVIDIA advierte explícitamente que la tasa de renderizado o la velocidad de inferencia pueden disminuir brevemente mientras G-Assist procesa una solicitud durante una carga de trabajo intensiva de GPU.

Una vez que finaliza la inferencia, esos recursos de GPU vuelven al juego.

Esto es diferente de un asistente en la nube, donde la mayor parte de la inferencia del modelo ocurre en un servidor remoto y no consume la GPU de juego.

La prueba de recursos del asistente local

Cómo juzgar si un asistente de juego local se adapta a tu PC

1
1. Verifica la VRAM instalada
La línea base actual de G-Assist es una GPU RTX con al menos 6 GB de VRAM.
2
2. Verifica la VRAM libre durante el juego real
La capacidad instalada no es lo mismo que la capacidad libre.
3
3. Elige el modo Razonamiento o Flash adecuadamente
Usa el modo más ligero cuando la presión de recursos importa más que el razonamiento profundo.
4
4. Mide las caídas de velocidad de fotogramas durante la inferencia
Observa el juego mientras le pides a G-Assist que realice tareas.
5
5. Inspecciona la autoridad de las herramientas
Conoce exactamente qué funciones integradas y complementos pueden cambiar tu sistema.
6
6. Trata los complementos de terceros como software
Revisa su código fuente, permisos, acceso a la red y credenciales almacenadas.

Por qué los complementos merecen el mismo escrutinio que cualquier otro software

Un complemento puede conectar el asistente a API, aplicaciones periféricas y servicios en línea.

Eso significa que un complemento puede manejar valores de configuración, credenciales o solicitudes externas dependiendo de para qué fue creado.

El repositorio de NVIDIA proporciona explícitamente una ubicación config.json para la configuración de complementos y advierte a los desarrolladores que no confirmen credenciales.

Por lo tanto, la pregunta de seguridad correcta no es solo "¿G-Assist es local?" sino también "¿A qué se conecta cada complemento instalado?"

G-Assist se parece más a un agente que a un chatbot

Un chatbot principalmente produce lenguaje.

Un agente interpreta un objetivo, observa información relevante, elige una acción, llama a una herramienta y evalúa el resultado.

G-Assist ahora se ajusta mucho más a esa segunda descripción porque puede coordinar múltiples acciones, inspeccionar el estado compatible de la PC e invocar herramientas reales.

Lo que G-Assist todavía no es

NVIDIA describe explícitamente a G-Assist como un asistente local especializado, no como una IA conversacional de propósito general.

Su valor proviene de comprender un conjunto enfocado de tareas de PC y gaming y de tener herramientas conectadas a esas tareas.

Ese enfoque es importante porque un modelo local más pequeño puede ser útil cuando el sistema que lo rodea le proporciona herramientas sólidas y límites claros.

¿Qué cambió en las versiones actuales?

El historial de versiones públicas actual muestra que G-Assist avanza constantemente hacia un agente local más capaz.

VersiónCambio importante
0.1.17Modelo más ligero, todas las GPU RTX con 6 GB+ de VRAM, complementos de la comunidad
0.1.18Optimización para portátiles, controles de BatteryBoost y WhisperMode
0.2Modo de razonamiento, modo flash, prompts de múltiples acciones, nuevos controles de dispositivo
0.2.1Sistema de conocimiento mejorado, mejores recomendaciones, controles de funciones RTX
0.2.2Integración con Elgato Stream Deck a través de un servidor MCP

¿Qué cambiaría esta respuesta?

G-Assist sigue siendo experimental y su arquitectura está evolucionando.

El tamaño del modelo, los requisitos de VRAM, el conjunto de herramientas, el protocolo de complementos y la compatibilidad de hardware pueden cambiar en futuras versiones.

Una versión futura también podría trasladar parte de la inferencia a una NPU o introducir una integración MCP más amplia, pero eso no debe darse por sentado hasta que NVIDIA lo documente.

Limitaciones

Este artículo describe la documentación pública del producto G-Assist de NVIDIA y la arquitectura pública de complementos a septiembre de 2026.

NVIDIA no documenta públicamente cada detalle interno de su canal de conocimiento y recomendaciones, por lo que este artículo no afirma que cada respuesta de conocimiento utilice RAG ni ninguna otra implementación de recuperación específica.

Los complementos de terceros pueden tener un comportamiento y un acceso a la red más allá de las funciones integradas de NVIDIA, por lo que cada complemento debe evaluarse por separado.

Conclusión

La forma más sencilla de entender Project G-Assist es dejar de pensar en él como un chatbot.

El SLM local interpreta tu solicitud. El conocimiento le ayuda a comprender el problema. La información del sistema en vivo le indica qué es cierto en tu PC. Una función integrada o un complemento define lo que realmente se le permite hacer. La herramienta realiza la acción y devuelve el resultado.

Eso es una arquitectura de agente local.

Su idea más fuerte no es que un modelo de 8 mil millones de parámetros pueda hablar sobre tu GPU. Es que un modelo local relativamente pequeño puede volverse útil cuando está conectado a herramientas bien definidas, al estado actual y a un límite de acción controlado.

Preguntas frecuentes

NVIDIA Project G-Assist en lenguaje sencillo

¿Es G-Assist un chatbot en la nube?

No. Su modelo de lenguaje principal se ejecuta localmente en la GPU GeForce RTX y puede funcionar sin conexión para las funciones locales compatibles.

¿Qué modelo utiliza G-Assist?

NVIDIA actualmente lo describe como un modelo instruct local basado en Llama con 8 mil millones de parámetros.

¿El modelo de IA cambia directamente la configuración de mi GPU?

No. El modelo selecciona una función integrada o un complemento compatible, y esa herramienta realiza el cambio real.

¿G-Assist utiliza VRAM mientras se juega?

Sí. NVIDIA recomienda VRAM libre adicional para el asistente y advierte que la inferencia puede reducir brevemente el rendimiento de renderizado del juego.

¿Los complementos de G-Assist son complementos MCP?

No directamente. El protocolo de complementos actual propio de G-Assist utiliza JSON-RPC 2.0, aunque un complemento puede conectarse a un servidor MCP.

¿Puede G-Assist funcionar sin conexión?

Su asistente local puede, pero los complementos individuales aún pueden requerir acceso a internet si llaman a servicios en línea.

¿Es G-Assist un asistente de IA general?

NVIDIA lo describe como un asistente especializado para PC y juegos en lugar de un modelo conversacional amplio de propósito general.

Glosario

Términos clave de G-Assist

SLM
Small Language Model (Modelo de Lenguaje Pequeño), un modelo de lenguaje compacto diseñado para ejecutarse localmente con requisitos de hardware menores que los grandes modelos en la nube.
Llamada a herramientas
El proceso mediante el cual un modelo de lenguaje elige una función definida y proporciona argumentos estructurados para que otro componente realice una acción.
Complemento
Una extensión que expone funciones o integraciones adicionales a G-Assist.
JSON-RPC 2.0
El protocolo de mensajes estructurados utilizado por el sistema de complementos actual G-Assist Protocol V2.
MCP
Model Context Protocol (Protocolo de Contexto de Modelo), un protocolo separado de interoperabilidad de herramientas y contexto que algunas integraciones externas pueden exponer.
Límite Herramienta-Autoridad
Un modelo de Figure Rocks que separa lo que un modelo de IA puede entender de lo que sus herramientas conectadas realmente le permiten hacer.
Pila de Agente Local
Un modelo de Figure Rocks que combina la intención del usuario, el SLM local, el conocimiento, el estado en vivo, la selección de herramientas, la ejecución y la verificación de resultados.
Prueba de Recursos del Asistente Local
Un flujo de trabajo de Figure Rocks para evaluar VRAM, costo de inferencia, permisos de herramientas y riesgo de complementos antes de usar un asistente de juegos local.

Fuentes primarias

NVIDIA — Project G-Assist

Página oficial actual del producto que cubre el modelo local, las funciones compatibles, los modos Reasoning y Flash, los requisitos de VRAM, los controles RTX, los complementos y la integración de Elgato basada en MCP versión 0.2.2.

NVIDIA — G-Assist GitHub

Repositorio público oficial de complementos que documenta la arquitectura de módulos de G-Assist, el descubrimiento de complementos y el Protocol V2.

NVIDIA — Guía de migración a G-Assist Protocol V2

Documentación oficial del protocolo que cubre JSON-RPC 2.0, inicialización, verificaciones de estado, ejecución, transmisión, finalización y comportamiento del SDK de complementos.

Blog de NVIDIA — Modelo ligero de G-Assist

Antecedentes oficiales sobre el modelo G-Assist de menor memoria, compatibilidad con GPU RTX de 6 GB y el centro de complementos de la comunidad.

Related Articles

Lista de verificación del router para gaming: los ajustes que realmente importan

La mayoría de los ajustes del router no ayudan. Estos ajustes sí: gestión de colas bajo carga, comportamiento estable del Wi-Fi y evitar funciones que añadan latencia o inestabilidad.

Modo Juego en TVs y Monitores: La Única Configuración Que Cambia Todo

Si un juego se siente pesado, revisa primero el modo de juego. Aprende qué desactiva el modo de juego, por qué reduce el retraso y cómo verificar que realmente está funcionando.

¿Los 120Hz se sienten peor? Lista de verificación de diagnóstico (Modo incorrecto, rango de VRR, límites)

Una mayor frecuencia de actualización puede exponer la inestabilidad. Usa esta lista de verificación para diagnosticar por qué los 120 Hz se sienten peor: modo incorrecto, ruta de actualización incorrecta, problemas de rango de VRR o falta de límites.

Glosario de modos de pantalla: Modo Juego, Modo PC, Modo Filmmaker (Lo que realmente cambian)

Los modos de visualización no son cosméticos. Cambian el procesamiento, el manejo de croma y la latencia. Usa este glosario para elegir el modo adecuado para la claridad y sensación de juego.

Conceptos básicos de cables y puertos de pantalla: Solución de problemas de handshake de 120Hz, VRR y HDR

Muchos ‘problemas de funciones’ son problemas de sincronización: puerto incorrecto, cable incorrecto, modo de entrada incorrecto. Usa esta base para restaurar 120Hz, VRR y HDR.

Conceptos básicos de NVIDIA Reflex: Cuándo ayuda (y cuándo no hace nada)

Reflex reduce el retraso de la cola de renderizado cuando el juego está limitado por la GPU y es estable. Conoce las condiciones prácticas en las que ayuda y las trampas que hacen que no sirva para nada.

Trampas del mezclador de audio de Windows: Por qué el audio de PC se siente inconsistente en los juegos

El audio de PC se siente aleatorio cuando el enrutamiento cambia silenciosamente. Aprende las trampas del mezclador (cambio de dispositivo predeterminado, mejoras, enrutamiento de aplicaciones) y cómo fijar una ruta estable.

Decisión de bandas Wi-Fi: 2.4 vs 5 vs 6E (Estabilidad para gaming primero)

Elige las bandas Wi-Fi por estabilidad, no por el hype. Usa esta guía de decisión para elegir 2.4, 5 o 6E basándote en la distancia, la congestión y el comportamiento real del jitter.

Mitos del Modo de Juego de Windows: Qué hace (y lo que realmente importa)

El Modo de juego de Windows no es un interruptor mágico de latencia. Los mayores beneficios aún provienen de un ritmo de fotogramas estable y del control de la carga en segundo plano. Úsalo, pero no lo adores.

Router Checklist v2: Los 12 ajustes que previenen los picos de lag

La mayoría de los picos de lag provienen de la carga y la inestabilidad, no de un ‘ping malo’. Usa esta lista de verificación para routers para estabilizar la latencia bajo carga antes de comprar equipo nuevo.

Trampas del procesamiento de pantalla: Los ajustes que arruinan en secreto la claridad y la sensación

Muchas pantallas vienen de fábrica con un procesamiento que se ve ‘bien’ en las películas, pero que arruina el gaming: latencia añadida, artefactos e inestabilidad. Aquí tienes la lista corta de qué desactivar y por qué.

Ethernet vs Wi-Fi para gaming: las verdaderas razones por las que Ethernet gana

Ethernet no se trata de la velocidad. Se trata de la consistencia: menos picos, menos interferencia y tiempos predecibles. Usa esto para decidir cuándo el Wi-Fi es ‘suficientemente bueno’.