Episodio #177

#177 TOKENS: cómo AHORRAR en Claude y usar mejor la IA

Resumen del episodio

Resumen elaborado a partir de la conversación del episodio.

Lo que aprenderás

  • Qué es un token, qué es la ventana de contexto y por qué cada mensaje vuelve a enviar todo el historial del chat.
  • Cómo usar /compact, /clear y /context para controlar cuánto contexto estás ocupando en Claude.
  • Por qué el caché de prompts ahorra tokens solo si trabajas de forma continua.
  • Cuándo conviene usar Haiku, Sonnet, Opus o Fable, y cuánto más cuesta cada uno.
  • Cómo los proyectos y los archivos en Markdown reducen el uso de tokens en tareas que se repiten.

Capítulos

  1. 0:00 Por qué los tokens son un recurso escaso: la ventana de 5 horas y la semanal
  2. 4:21 Qué es un token y cómo funciona la ventana de contexto
  3. 12:53 Qué pasa cuando se llena la ventana de contexto: /compact y /clear
  4. 17:43 Cómo revisar tu uso en Settings y con el comando /context
  5. 24:42 El caché de prompts y su duración de 5 minutos
  6. 30:23 Cómo desactivar Skills, conectores y plugins
  7. 33:54 Elegir el modelo: Haiku, Sonnet, Opus y Fable
  8. 47:04 Proyectos y memoria en Claude
  9. 53:45 Convertir archivos a Markdown para gastar menos tokens
  10. 57:00 Horarios peak, scripts, preguntas agrupadas y plugins de la comunidad

Qué es un token y cómo funciona la ventana de contexto en Claude

Jonathan Vásquez y Nolan Gaete parten por lo básico. Claude tiene un límite de uso en una ventana de 5 horas y otro semanal, y cuando se agota, la tarea se detiene a medias. Anthropic no muestra cuántos tokens quedan, sino un porcentaje, que se revisa en la sección de uso de Settings.

Un token es un pedacito de información que procesa el modelo; también las imágenes, los videos y los audios se convierten en tokens. La ventana de contexto es toda la información que se envía en cada mensaje, y cada mensaje nuevo vuelve a enviar todo el historial, tanto lo que escribiste como lo que respondió Claude.

La ventana también incluye lo que no se ve: el prompt de sistema de Anthropic, los resultados de herramientas como la búsqueda en internet y los archivos cargados. En la demostración de Jonathan, sin enviar ningún mensaje, el prompt de sistema ya ocupaba 24500 tokens, cerca del 5%. Y un contexto más largo degrada el desempeño del modelo.

Comandos para gestionar el contexto: /compact, /clear y /context

Cuando la ventana se acerca a su máximo, Claude avisa. El comando /compact resume la conversación y la carga como base de un chat nuevo. En Claude Code, /clear limpia toda la ventana cuando ya terminaste una tarea; en la aplicación, lo equivalente es abrir un chat nuevo.

El primer tip es medir. El comando /context, disponible en Claude Cowork y en Claude Code, muestra cómo se reparte la ventana entre prompt de sistema, herramientas, MCP, Skills y mensajes. En la versión beta que corre en la nube no aparece.

Entonces acostúmbrense a ir utilizando el /context constantemente.

Jonathan Vásquez

En la sección de personalización de Settings se activan o desactivan Skills, conectores y plugins. En la prueba de Jonathan, las Skills pasaron de 1800 a 3300 tokens al activar unas 7. Algunos plugins, como uno de Vercel, activan Skills que solo se apagan desde el propio plugin.

El caché de prompts: por qué conviene trabajar sin pausas largas

Anthropic guarda en caché los tokens ya procesados para no reprocesarlos, de forma automática. Ese tiempo de vida, el TTL, se creía de 1 hora, pero tras distintos testeos todo indica que hoy es de 5 minutos: si vuelves media hora después, se reprocesa todo. Según la tabla que muestra Jonathan, el ahorro parte en el segundo mensaje con un 32,5% y llega a 84,2% a los 20 mensajes en el mismo chat.

Cómo elegir entre Haiku, Sonnet, Opus y Fable para ahorrar tokens

Nolan propone una guía general. Haiku, el más rápido y barato, basta para traducir, resumir o redactar un correo. Sonnet sirve para tareas con archivos y herramientas, como analizar un Excel, y cubre la mayor parte de un día de trabajo. Opus es para planificaciones de varios pasos y Fable para tareas muy complejas; Fable no viene en el plan gratuito, en el de 20 dólares ni en Teams, y en los planes Max consume el límite mucho más rápido.

Tomando Haiku como base, Sonnet es 3 veces más caro, Opus 5 veces y Fable 10 veces. En una prueba interna de traducción, Haiku costó 9,9 centavos de dólar y Opus 77 centavos, sin diferencia de calidad. Una estrategia es planificar con un modelo potente, por ejemplo con /plan en Claude Code, y ejecutar con otro.

Pidámosle al senior, al consultor senior, que planifique, que piense, que razone todo lo que necesita y después ya cuando sabemos qué hacer exactamente vamos al junior y que haga la tarea.

Nolan Gaete

Proyectos y Markdown para tareas recurrentes

Si siempre usas los mismos archivos, los proyectos de Claude dan un contexto base con archivos, instrucciones y memoria. Los locales usan una carpeta del computador y no se comparten; los online se pueden compartir, pero tienen un límite de tamaño de archivos.

El formato también importa: una tabla en PDF gastó 736 tokens y la misma tabla en un archivo .md, 156 tokens, porque los PDF y Excel cargan metadatos de formato. Se puede convertir con ChatGPT o Gemini gratuitos, pero nunca con información sensible de la empresa.

Si usted tiene información en PDF, en un archivo Word, trate de pasarlo primero a Markdown, y después de que lo pasa a Markdown lo carga.

Jonathan Vásquez

Al cierre, Jonathan cuenta que Thariq Shihipar, trabajador de Anthropic, publicó que la ventana de 5 horas se consume más rápido en horario peak. Suma otros tips: usar scripts para tareas repetitivas, enviar varias preguntas en un solo mensaje y probar plugins de la comunidad para Claude Code, como Ponytails, Caveman y Graphify.

Preguntas frecuentes

¿Qué es un token en Claude?

Es un pedacito de información que el modelo procesa. Texto, imágenes, videos y audios se convierten en tokens, y Claude muestra su consumo como porcentaje de las ventanas de 5 horas y semanal.

¿Cómo ahorrar tokens en Claude?

Revisa tu contexto con /context, desactiva Skills y plugins que no uses, trabaja sin pausas largas para aprovechar el caché, elige el modelo según la tarea y usa proyectos y archivos en Markdown.

¿Qué hace el comando /compact en Claude?

Resume la conversación de la ventana de contexto y la carga como base de un chat nuevo, para seguir trabajando cuando te acercas al límite. Para partir de cero, Claude Code tiene /clear.

Descripción

Este capítulo fue auspiciado por 

📌 Duemint: ⁠⁠https://land.duemint.com/contacto-evo⁠⁠

📌 Hostinger: ⁠http://www.hostinger.com/evo 

Los tokens se están convirtiendo en uno de los recursos más importantes al trabajar con inteligencia artificial. En este capítulo, explicamos cómo funcionan los tokens y la ventana de contexto en Claude, por qué podemos estar consumiéndolos sin darnos cuenta y qué elementos (como Skills, MCPs, archivos y herramientas) pueden aumentar nuestro uso.

Además, revisamos estrategias para ahorrar tokens: caché, Compact, Clear, Projects, elección de modelos y conversión de archivos a Markdown. Una conversación práctica para quienes quieren sacar más rendimiento de Claude y optimizar sus flujos de trabajo con IA.

🎧 Escucha el capítulo completo y descubre cómo trabajar de forma más eficiente con inteligencia artificial.

⭐ Recuerda evaluarnos con 5 estrellas ⭐ así nos ayudas a llegar a más personas y seguir compartiendo conocimiento sobre IA y tecnología aplicada a los negocios.

—

📲 Sigue nuestra comunidad:

https://www.evoacademy.cl/comunidad

Redes sociales:

TikTok: https://www.tiktok.com/@evoacdm

Instagram: https://www.instagram.com/evoacdm/

LinkedIn: https://www.linkedin.com/company/evoacmd/

#InteligenciaArtificial #Claude #Tokens

—

00:00 – Entendiendo los Tokens: Un Recurso Escaso en IA07:13 – Cómo Funciona y Crece la Ventana de Contexto12:55 – Reduciendo Costos con /compact y /clear17:50 – Cómo Revisar tu Presupuesto y Contexto en Claude23:59 – Aprovecha el Caché y Desactiva Skills Innecesarias33:54 – Haiku, Sonet, Opus: ¿Cuál Usar y Cuándo?47:07 – Organiza con Proyectos y Usa Formato Markdown57:14 – Evita Horas Pico y Descubre Plugins para Claude01:08:38 – Consejos Finales para Optimizar el Uso de Tokens

Transcript

Este transcript fue generado automáticamente por lo que podría contener errores

Ver transcript detallado

0:00 Nolan Gaete: En la actualidad hay un recurso que está siendo sumamente escaso: los tokens. Si tú estás utilizando Claude o estás utilizando ChatGPT o quizás alguna otra plataforma que tengan algún límite semanal, diario, por horas, etcétera, todos los tips que vamos a dar en este capítulo te sirven para eficientar ese uso de tokens. Quédate en este nuevo capítulo de Inteligencia Artificial para los Negocios. Jonathan, muchas gracias por estar aquí este capítulo y explicarnos esto de utilizar Claude con eficiencia. ¿Qué vamos a ver hoy? Explícame un poco primero qué es lo que vamos a ver y después ya vamos punto por punto.

0:46 Jonathan Vásquez: Muchas gracias por la recepción después de no sé cuántos capítulos sin haber aparecido. Yo creo que mucha gente pensó que ya no seguía. No, siempre sí, siempre estuve ahí.

0:55 Nolan Gaete: Panelista pródigo.

0:56 Jonathan Vásquez: Claro, como por ahí dicen, el jefe shiny. Referencia ñoña, pero bueno. Y respondiendo a esta pregunta es básicamente ver algunos tips de cómo podemos hacer que Claude sea más eficiente, particularmente en un punto que siempre es criticado, que es el uso de los tokens, ¿no? Ese aviso que siempre nos aparece como ya llegaste al tope del uso. Se te va a acabar. Claro, o ya se te acabó la de 5 horas o la semanal. Entonces el punto que planteamos hoy día es qué podemos hacer para ojalá eficientar eso y ojalá que no se gaste tan pronto la cantidad de tokens en las ventanas que nos entrega Anthropic.

1:35 Nolan Gaete: Exacto, porque es decir, partiendo con esto, por si es que no se han dado cuenta, que no creo, que el que lo está ocupando, Claude, ya lo sabe, existe una ventana primero de 5 horas y después hay una ventana en paralelo de una semana. Depende de cuándo lo comenzaste a usar es cuando tiene como su reinicio. Entonces no es que tú puedas ocupar onda las 5 horas full cada 5 horas, porque eventualmente el de la semana se va a ocupar y también se te detienen todos los procesos. De hecho, es molesto cuando uno está pidiéndole algo y de repente, ah, lo siento, no puedo, y ni siquiera termina esa tarea. Es frustrante.

2:16 Jonathan Vásquez: Bastante frustrante. Entonces, para evitar eso, hicimos este podcast. Hay varios conceptos que tú hablaste que yo creo que primero tenemos que empezar a aclararlo. Yo hablé de tokens, tú hablaste de ventana de contexto. Entonces, todas esas cosas vamos a partir por ahí explicándolo primero para asegurarnos de que la gente lo sepa. Si usted ahí en la casa, el que nos está escuchando, ya sabe de esto, bueno, puede adelantar ahí o asegurarse a ver si es que efectivamente—

2:37 Nolan Gaete: hágase pruebas.

2:38 Jonathan Vásquez: Sí, haga una prueba a ver si token significa esto o la ventana de contexto significa tal cosa. Claro, pero el objetivo es que vamos a partir primero con esos dos conceptos para que quede un poco claro y cada vez que nosotros expliquemos lo posterior se entienda mucho mejor. Primero partir, ¿qué es Claude? Si alguien ya está acá en realidad debería saber Claude, pero básicamente esta aplicación que tiene Anthropic y que tiene, por así decirlo, en distintos sabores porque está como la versión Claude, la normal en chat, está el Claude Cowork, está el Claude Code, está el Claude Science, no sé qué otro, yo creo que Science. El Design también y ahí tengo, bueno, en pantalla estoy mostrando los distintos símbolos utilizadores que tiene Anthropic para su aplicación de Claude, como la distinta versión de esta aplicación. Así que lo que nosotros vamos a hacer hoy día es tratar de dar algunos tips que no son aplicados solamente a alguna de estas, valga la redundancia, aplicaciones, sino que se puede ser aplicado en algunas de estas distintos tipos de versiones de Claude. Y ahí eso un poco es un disclaimer igual importante darlo, porque cuando uno empieza a buscar información sobre cómo hacer más eficiente el uso de los tokens generalmente se enfoca mucho a Claude Code.

3:42 Nolan Gaete: Sí, es verdad.

3:44 Jonathan Vásquez: Entonces lo que nosotros tratamos de hacer acá es responder a la otra parte que eventualmente está vacía, no está satisfecha esa demanda de, está bien, lo de Claude Code me sirve también para la, alguno, para las otras versiones como Cowork o todas las otras que nombré. Así que nosotros decidimos hacer este podcast, así que vamos a hablar cosas de Claude Code también, pero también de otras.

4:02 Nolan Gaete: Claro, y tener en cuenta que hay varios conceptos que Claro, nosotros estamos tomando para este capítulo a Claude y todos sus sabores, como tú dijiste, como línea vertebral. Sin embargo, hay varios conceptos y técnicas que también pueden servir para otros proveedores de inteligencia artificial generativa.

4:21 Jonathan Vásquez: Sí, eso es verdad, es un buen punto también el que planteaste. Entonces vayamos por lo primero, que es, qué es un token. Ya, perfecto. Un token lo vamos a definir como un pedacito de información del texto que se entrega a los modelos. Ya, entonces Básicamente lo podemos entender entonces como la cantidad de texto que va a procesar. Entonces, por ejemplo, ahí en pantalla mostramos que tenemos la frase bienvenida a este curso de inteligencia artificial, donde cada color separado por un conjunto de caracteres significa que es un token, y ese token es un procesamiento que hace Claude. Entonces, cuando ustedes vean que van a empezar a usar esta plataforma, aquellos que son nuevos en utilizar Claude, les va a aparecer mucho este concepto: te quedan tantos porcentajes de tokens, o te queda muy poco uso. De hecho, una ventana de contexto de algunos de los modelos que la mayoría usa es de 1 millón de tokens. Claro, ya a esto nos referimos, o a esto se refiere con el uso de los tokens. Ojo que esto también se aplica también a los conceptos de imágenes. Las imágenes también tienen, se transfieren a tokens, es decir, algún pedazo, alguna parte de la imagen también se transfiere como un token. Videos, audios, todo tiene este mismo concepto, es decir, la información que entrega yo la separo en pedazos de información que después posteriormente después los modelos los van a procesar. Entonces eso es lo primero saberlo, y uno lo que tiene, eso es lo que tiene, uno tiene un budget que es un presupuesto de 5 horas. Es decir, lo que hace entonces Anthropic es decir mira, en 5 horas tú tienes para utilizar esta cantidad de tokens. No te dice la cantidad, sino que te la muestra como porcentaje. Este muestra un porcentaje, usted utilizó el 10% de la cantidad de tokens que usted tiene asignado, usted utilizó un 90%, etcétera. Te lo muestra así, lo mismo que el semanal. Te dice, usted ocupó tanta cantidad de tokens, tanto porcentaje. Te lo muestra de esa manera, en una perspectiva relativa. Y yo creo porque tiene un objetivo ese y después más adelante lo vamos a hablar. Ahí hay cosas que están interesantes relacionado con cuánto es lo que te da y cómo lo ocupas, cómo calcula el uso Anthropic respecto a la cantidad de tokens.

6:15 Nolan Gaete: Claro.

6:16 Jonathan Vásquez: Entonces, ese es el primer concepto. Muchas empresas crecen con procesos financieros manuales, cobran a cada cliente, consideran las facturas con procesos lentos y arman nóminas en el clásico Excel. Eso puede funcionar por un tiempo, pero cuando el negocio comienza a crecer, esa forma de operar empieza a ponerle techo al crecimiento, pues te quita tiempo de la operación y te deja expuesto a errores que te pueden costar caro. Hoy, gracias a la automatización y la inteligencia artificial, las finanzas pueden ser más smart. Duemint es una plataforma que te permite manejar tus finanzas de una manera más inteligente y ágil, integrando más de 60 plataformas como el Servicio de Impuestos Internos, diversos bancos, entre otros, para así hacer tus finanzas más fáciles. Deja atrás manualidades y únete a las más de 1000 empresas que ya operan con una visión financiera más inteligente usando Smart Finance de Duemint. Conoce la plataforma en el QR que está ahora en pantalla o en el enlace que encontrarás en la descripción. Y el segundo concepto viene relacionado con la ventana de contexto. Ya, ¿a qué se entiende por la ventana de contexto? Se entiende toda la información que yo le envío en cada mensaje a Claude y que este lo va a procesar. Ya, claro. ¿Qué incluye la ventana de contexto? Incluye los mensajes previos que tú enviaste en el chat, como también los mensajes que ha creado, o toda la información que ha creado el asistente. En este caso, Claude puede ser Claude, Claude Cowork, o Code. Todas esas cosas se suman. Ya, de eso igual es importante saber acá que cada vez que ustedes envían un nuevo mensaje se vuelve a enviar todo el historial hacia atrás.

7:51 Nolan Gaete: Ya, claro, tanto lo que tú enviaste como lo que Claude te respondió, es decir, input y output, uno, cada uno de esos cobra, y también todo el historial también se envía completo.

8:02 Jonathan Vásquez: Claro, y para que quede claro, acá generé cómo funciona la ventana de contexto, porque además dinámica. Entonces, por ejemplo, acá en pantalla podemos ver que en un inicio uno envía una cantidad de mensajes, por ejemplo, acá sale en verde todo lo que se considera como ventana de contexto, que son los mensajes que yo envié previamente, los mensajes que le creo al asistente y el nuevo mensaje que acabo de crear. Ya, eso se considera como parte de la ventana de contexto que yo estoy enviando. Entonces ahora lo que hace Claude procesa todos esos textos, imágenes, documentos, llamados a tools que pueda hacer, y me responde con un nuevo mensaje. ¿Qué ocurre? ¿Qué pasa? Que yo ahora le voy a volver a responder ese mensaje, ¿no? Claro, entonces mi ventana de contexto ahora aumenta. Entonces voy a hacer una segunda llamada y esa segunda llamada incluye todo lo que ya veníamos creando más el nuevo mensaje que acabo de crear. Y eso es repetitivo y constantemente se va a ir agregando. Entonces entiéndanlo que cada vez, fíjense que estas 3 son, son, son 3 usos distintos que se va aumentando en la cantidad de tokens que se van creando. Y no piensen que el token nuevo que yo voy a crear solamente el nuevo mensaje, no. En esta segunda llamada, por ejemplo, que tengo acá, o en esta tercera llamada que tengo acá, incluye, por decirlo, he llamado 3 veces el mismo mensaje que ya he enviado anteriormente. Entonces es importante saberlo, que cada vez que yo voy creando chats más largos, cada vez estoy pidiendo que vuelva a procesar la misma información que ya se la mandé en mensajes anteriores. Así que es muy importante ir controlando la ventana de contexto. Y acá es lo último importante, es que la ventana de contexto tiene un máximo, ya generalmente de 1 millón. Creo que son estos de 1 millón, no sé si cambian los otros modelos la ventana de contexto.

9:49 Nolan Gaete: Creo que incluso uno puede seleccionar si es que quiere llegar al millón y obviamente ahí te cobran un poquito más, pero es variable.

9:57 Jonathan Vásquez: Entonces, ¿qué es lo que va ocurriendo? Esta ventana de contexto en cada una de las llamadas se va completando y hay un punto en que tú llegas a una ventana de contexto máxima que incluso te la indica. Hay un indicador ahí en el chat que te indica cuándo vas a llegar a la ventana de contexto y ahí lo que tienes que hacer es aplicar ciertas técnicas que vamos a ver más adelante. Ahora entonces, ¿qué incluye la ventana de contexto? Bueno, para que la gente lo sepa, no solamente incluye los mensajes que creó el asistente o los que yo envié previamente, sino que también algo que se llama el prompt de sistema, que lamentablemente, bueno, no sé si lamentablemente, pero tiene un sentido de negocio, es que Son instrucciones que le da Anthropic a sus aplicaciones para seguir ciertos comportamientos, pero que se le oculta al usuario final. Ustedes cuando abren un chat, lo primero que se carga ya hay un conjunto de instrucciones entregados por Anthropic a Claude para que siga cierto comportamiento. Entonces ustedes ya le están ocupando una parte de contexto sin que ustedes lo sepan.

10:54 Nolan Gaete: Ahí hay como un costo base que aunque le mandes un punto, de todos modos eso va.

11:00 Jonathan Vásquez: Sí, sí o sí, eso va, ya. Y ojo que eso no solamente ocurre con Claude, también ocurre con ChatGPT, ocurre con Gemini, con todas las aplicaciones que ustedes utilizan. Y es porque los dueños de estos sistemas o de estas aplicaciones quieren controlar el comportamiento de esta aplicación y lo hacen a través de esta forma, ya. Solo número 1. ¿Qué otra cosa más incluye? Las llamadas herramientas. Cuando hay llamadas herramientas, por ejemplo, tú le pides a Claude que vaya a buscar información a internet, bueno, esa información que irá a buscar y trae y la carga como para poder procesar tu información, también forma parte de tu contexto, cosa que a veces tú no ves. Eso que dice como las fuentes que aparecen ahí, ya, esas fuentes que te aparecen listas también lo agrega. Cuando entonces eso también es parte de, claro, uno no lo lee, no lo ve como el texto que agregó, pero tienes que considerar que también se suma a tu ventana de contexto. Otra cosa más que se sube a tu ventana de contexto son los archivos, ya, archivos que uno le carga, archivos que irá a buscar, ya. Archivos que eventualmente tiene cargado por default, que esos son también tokens que se cargan y se suman a tu ventana de contexto y que uno no los ve como texto, digamos, no es tan visual, pero sabe que está ahí, entonces te va a ocupar parte de tu ventana de contexto. Así es que cuidado cada vez que ustedes estén utilizando la ventana de contexto, no son solamente a través del texto o de los mensajes, sino que hay un conjunto distinto de otra información que también se van cargando y te va ocupando dentro de tu ventana de contexto. Entonces, el primer mensaje, si usted quiere empezar a utilizar bien la cantidad de tokens, sea más consciente de las cosas que va cargando al chat.

12:41 Nolan Gaete: Claro, que sea así como bien preciso para la tarea, no redundante en otras cosas.

12:46 Jonathan Vásquez: No es como ya carguémosle todos los archivos nomás. Ojo, si usted le carga cada vez más archivos, más parte del contexto va a utilizar.

12:53 Nolan Gaete: Ya, pero ¿y cuál es el costo? Ya, ¿qué pasa si la lleno? ¿Me va a decir hoy no puedo trabajar más? ¿No me va a responder? ¿Se va a cerrar? ¿Qué va a pasar?

13:04 Jonathan Vásquez: No, el costo, bueno, hay varios costos. El primero, hay un costo asociado con que tiene que considerar que lo que se ha mostrado dentro de la literatura es que a medida que esta ventana de contexto va creciendo, el desempeño de los modelos se degrada. Ese es un primer costo a considerar. Entonces aquí en pantalla estamos viendo un artículo que hizo distintos análisis donde va mostrando cómo a medida que vamos creciendo la ventana de contexto mediante tokens, algo que ya vimos al principio, la capacidad del modelo de capturar correctamente la información va disminuyendo. Entonces el primer costo es que cada vez que lo tenemos estos contextos más largos, más difícil que nuestro modelo eventualmente pueda ejecutar bien su tarea. Entonces ese es el primer costo. Y el segundo costo está asociado a que si ustedes le quieren entregar más información, es decir, estoy llegando a mi límite de tokens, el modelo va a decir no lo puedo procesar porque no puedo agregarlo dentro de mi tope máximo, que en este caso, por ejemplo, el que hablamos al principio es de 1 millón. Generalmente te avisa cuando te quedan como 80 o está ocupando el 80% de tu ventana de contexto o el 90% de ventana de contexto te empieza ya a avisar. Entonces, ¿qué es lo que podemos hacer ahí? Bueno, hay un comando, o de hecho te lo ofrece el mismo Claude, que es compact, ya que lo que tú puedes hacer es apretar, hacer /compact y te compacta la información que está dentro de tu ventana de contexto.

14:34 Nolan Gaete: Y en ese sentido, este /compact lo que hace es como sacar un resumen, lo compacta literalmente, hace como un zip y lo guarda.

14:46 Jonathan Vásquez: No, lo que hace es un resumen de la información que está dentro del chat de la ventana de contexto y esa información después la agrega a tu siguiente, es como que tú abres un nuevo chat con este resumen que acaba de hacer el modelo y lo agrega a tu ventana de contexto nueva. Ah, perfecto. Entonces esa es una, usar el /compact o la otra también que creo que está solamente en Claude, no lo he probado, perdón, en Code, es que yo uso Claude Code privisimamente. Ah, el viejo, el viejo, el que programa. Porque por ejemplo aquí estoy viendo que en Cowork no me aparece el /compact. Sí, pero sí recuerdo que hay un botón que no tengo el ejercicio, pero que tú aprietas y te hace el compacto y te lo compacta.

15:25 Nolan Gaete: ¿Y qué gano con entonces el /compact además de tener este resumen que tú dijiste?

15:30 Jonathan Vásquez: Bueno, lo que ganáis es que si tú quieres seguir trabajando con la información que venías ahí, pero el modelo te dice oye, estás llegando a tu tope máximo de la ventana de contexto, es que puedes recuperar información que tengas dentro del chat y lo llevas a un nuevo chat. Ya, entonces básicamente hace eso, es como que hace un zip, por así decirlo, pero un compacto de la información importante de todo lo que está dentro del chat y crea un nuevo chat con esta información adicional que la carga por default.

15:57 Nolan Gaete: Y tú tienes acceso a ese resumen, porque qué pasa si no resumió o no consideró un punto que según yo era importante pero Claude dijo, ah no, esto lo voy a guardar aquí en el basurero.

16:08 Jonathan Vásquez: Es una buena pregunta, yo nunca he podido acceder a eso y si lo existe, no sé, tú lo sabes de alguna, porque yo siempre Utilizo los compacts y dice ya, la información ya está compactada y tú la empezás a utilizar. A mí me ha funcionado que cada vez que le hago preguntas sí aparece, entonces al parecer eso está bien desarrollado pero un buen punto es que tú no tienes ese harness como ese control de qué es lo que quiero que incluya o no quiero que incluya.

16:31 Nolan Gaete: Claro, yo con el miedo porque tampoco lo he encontrado así explícitamente, las cosas importantes igual se las recuerdo por si acaso.

16:39 Jonathan Vásquez: Claro, es que también puedes tomar eso. Bueno, esa es la otra opción de que tú abras un nuevo chat y tú controles qué quiero nuevo cargarle a este nuevo chat. Esa es la segunda opción también. Ya, perfecto. Y la otra opción que existe también de si tú quieres, como si estoy llegando a la ventana final y ya terminé mi tarea, es en Claude Code utilizar el /clear. Ya, /clear lo que hace es que te limpia el chat completo y tú puedes partir desde nuevo. Pero eso es distinto al compact porque ahí está asumiendo ya, ok, eso sirve generalmente cuando tú estás haciendo una tarea, ya la terminaste, pero te queda poquita ventana de contexto y quieres seguir trabajando con Claude Code, por ejemplo, que funciona solamente ahí. Entonces es como abrir una nueva ventana pero continuar en el mismo chat solamente.

17:21 Nolan Gaete: Ya, perfecto. Y ese /clear está en la aplicación o funciona solamente en el CLI?

17:28 Jonathan Vásquez: En el CLI, porque claro, en la aplicación tú abres nuevo chat nomás, pero en el CLI /clear te limpia toda la ventana de contexto.

17:37 Nolan Gaete: CLI, por si acaso, para los que no conocen el concepto, es cuando lo trabajas sobre el terminal. Así que no me equivoco, ¿cierto?

17:43 Jonathan Vásquez: Sí, trabajas con el terminal. Perfecto. Entonces eso es lo primero, ya hay que tener, esta es la forma de ir gestionando la ventana de contexto. ¿Cómo puedo ir gestionando cuánto tengo de mi ventana de contexto? ¿Cuánto me queda respecto al uso de que yo tengo semanalmente? Bueno, Claude te entrega esa información. Tú tienes que ir acá a Settings, y eso lo vamos a mostrar acá en pantalla. Tú te vas a Settings, te vas a la sección de uso Ya, yo lo tengo en inglés lamentablemente. Y aquí aparece cuánto yo tengo en mi sesión actual. Ya, lo primero que aparece arriba es el porcentaje de uso que tú tienes en una ventana de 5 horas. Si han pasado más de 5 horas o no has enviado un primer chat, un primer mensaje, esto no se activa. Por eso aquí me dice que esto va a empezar a correr el tiempo a través que envío el primer mensaje. Y abajito aparecen los límites semanales, que yo por ahora he usado un 67%, 67%, y en unos 48 minutos más se va a resetear.

18:45 Nolan Gaete: Yay, voy a volver trabajando.

18:48 Jonathan Vásquez: Sí, exactamente. Ya, entonces eso es lo primero que hay que empezar a hacer. Ya, súper. Bueno, acá está la amarilla. Ahora la pregunta es, ok, pero eso es para controlar el budget o el presupuesto que yo tengo semanal o cada 5 horas. Si yo quiero saber cómo se comporta mi ventana de contexto, qué, dónde se está usando más, o sea, con todas estas cosas que yo les dije anteriormente, mira, se carga la cantidad, hay un prompt de sistema que lo agrega Anthropic, se cargan también herramientas, se cargan filosofías. ¿Cuánto de mi contexto que tengo actualmente se está usando en cada una de esas características? O sea, cada una de estos tipos de información. Bueno, existe el comando /context, ya que sirve para Claude Cowork y sirve también para Claude Code. Perfecto. Y se los voy a mostrar. El Claude Code es más bonito en todo caso. El CLI debo decirlo, que en Claude Code es mucho más bonito. De hecho, ahí en pantalla ustedes pueden ver las dos diferencias. Fíjense que acá a la izquierda es la forma en que me lo muestra en Claude Cowork y el lado derecho es la forma en que muestra en Claude Code. Me muestra, de hecho, me muestra con colores, un gráfico, aunque el CLI supuestamente uno dice que es más feo, pero es mucho más completo bajo mi perspectiva. Claramente son cosas de gusto acá, ya, pero les voy a mostrar las dos diferencias. Entonces, por ejemplo, vamos a ir al chat, voy a hacer un nuevo chat y voy a seleccionar Cowork. Y fíjense, yo no voy a mandar, no he mandado ningún mensaje, pero voy a decir, voy a escribir, voy a utilizar el comando /context. Advertencia, ojo, que nos ha pasado a nosotros que de repente hay gente que no le aparece el contexto. Cuando hacemos las clases o incluso a uno.

20:23 Nolan Gaete: Y es porque muy probablemente acá arriba a la derecha ustedes están corriendo en la nube, el, sí, el beta que ahora sacaron como para poder trabajar desde cualquier parte. Pero por lo menos la fecha de que lo estamos grabando es muchísimo más lento. Y además, como te prestan un computador temporal, no necesariamente va a quedar en tu computador, como que Ahí hay varias preguntas todavía técnicas.

20:51 Jonathan Vásquez: Y te tengo otro contra, que el que estamos hablando ahora no tiene el /context. Se está trabajando en la nube. Asegúrense que sea en su computadora. Entonces fíjense que yo voy a correr el /context, que es este comando que me muestra cómo se comporta mi ventana de contexto, o sea, cómo se distribuye el uso de mi ventana de contexto. Entonces le voy a poner play y aquí me va a entregar todo un informe, aquí está detallado. De cuánto de mi ventana de contexto utilizado. Fíjense que hasta el momento yo con Claude Sonnet tengo una ventana de 5000, perdón, tokens, y tengo utilizado el 9%. Pero, ¿cómo? Si no ha mandado ningún mensaje. Aquí está la muestra de que está, hay un porcentaje que lo voy a utilizar Anthropic, un prompt de sistema, y que son 24500 tokens, que es aproximadamente el 5% sin pedir mi permiso, o creo que sí, sí, usé un 5%. Y aquí se van sumando varias otras cosas que están escondidas. Están, por ejemplo, las herramientas de sistema. Anthropic por default tiene ciertas herramientas que las carga para poder trabajar. Claro, tiene herramientas de MCP, de que ya hemos visto y hemos conversado aquí en el canal. Tú has creado buenos MCP hoy día para la empresa, así que están interesantes. Aquí están cargados, para aquí, aquí tú me estás ocupando algún, sí, ahí estás tú. Ya están skills, ya las skills que eventualmente también se cargan. Y aquí vamos a ver más adelante, probablemente, ojo, que uno de los efectos principales de por qué estoy usando o tengo mucho utilizado sin haber enviado ningún mensaje al chat es porque quizás tengo skills que las estoy cargando por default y no la he desactivado. Entonces aquí uno lo puede ver, puede ver, ahí hay 8 mensajes. Ya muy probablemente esto para mí el indicio es que antes de que esto inicie ya hay algunos mensajes en el chat entremedio que lo cargó por default, porque aquí dice que hay 8 mensajes. ¿Qué mensajes? Yo no he enviado ninguno.

22:42 Nolan Gaete: No he apretado enter.

22:43 Jonathan Vásquez: Sí, entonces aquí muestra la cantidad de mensajes ya enviados, bueno, y el espacio que yo tengo, que son 422.500 tokens. Bueno, y abajo una lista importante detallada de qué skills están cargadas, cuántos MCP están cargados, etcétera. Ya, súper. Bueno, y en Claude Code funciona algo muy parecido. Acá yo voy a abrir la terminal y fíjense que acá funciona también el contexto, te va a abrir el contexto. Es mucho más bonito también, aquí lo van a ver. Mira qué hermosura, mi dibujo ahora está con colores, po. Me muestra el, me está mostrando un grafiquito de espacio utilizado por los distintos tokens, me muestra un poco la comparación que yo pueda hacer, aquellos que están utilizados por sistema. También me muestra de hecho agentes que tengo cargados, skills que tengo dentro, cuánto utilizado de mensaje. Y así sucesivamente, pero es el mismo /context.

23:40 Nolan Gaete: Ya, que te lo muestra con un poquito más de detalle y más claro quizás para la vista.

23:45 Jonathan Vásquez: Al menos a mí me gusta más, voy a asumir preferencias colores, como gustos sabores, ¿cómo es? No me acuerdo qué dicen.

23:54 Nolan Gaete: Una de las dos.

23:55 Jonathan Vásquez: Una de esas dos.

23:55 Nolan Gaete: Dejémosla ahí.

23:56 Jonathan Vásquez: Es día viernes, ¿no? Pero ese sería el primer, yo creo que aquí podríamos partir ya con el primer tip. ¿Cómo yo puedo ir mejorando entonces el uso de Claude? Bueno, revisa cómo se comporta tu contexto. Claro, probablemente tienes skills cargadas, probablemente tienes MCP o tools cargados o plugins que están cargados que te están ocupando contexto. Entonces aquí aparecía el primer, el primer mensaje o tips que le quedaría. Entonces acostúmbrense a ir utilizando el /context constantemente. Si no se mide todo lo que no miden, ustedes no saben cómo funciona. Entonces, para que sepan cómo está funcionando context, utilicen el slash context. Ya llegué a un punto importante que quiero hablar antes de pasar. No sé si va a decir algo, preguntarme algo, ¿no?

24:39 Nolan Gaete: No, no, no, adelante, adelante, por favor.

24:42 Jonathan Vásquez: Es que por ahí probablemente a veces que nos comentan o nos dicen, y que yo he visto que cuando han comentado nos hablan un poco de un concepto importante que generalmente lo manejan más la gente que desarrolla aplicaciones utilizando la API de Anthropic. Que es sobre el caché o el cache, ya. ¿Qué nos referimos nosotros con el cache o el caché? Es información que, o tokens que ya ha procesado Anthropic o Claude, pero que la deja guardada para que el día de mañana, si me están pidiendo vuelva a procesar estos tokens, no las vuelva a procesar, sino que utiliza el caché.

25:16 Nolan Gaete: Ah, perfecto.

25:17 Jonathan Vásquez: Y eso, ¿qué permite? Que el costo o la cantidad de tokens tokens solamente procesados se disminuye. Es decir, eso es un poco la gracia de que tengan este sistema y eso hace mucho más eficiente tanto para Anthropic, para un usuario que se conecta directamente a los modelos o uno como usuario de Claude Cowork o Claude Code. En un principio uno podría pensar que esto está solamente aplicado a aquellos que desarrollan, pero no. Hice mi averiguación y Anthropic utiliza también el prompt caching para poder disminuir el uso de sus prompts. Y eso hay que activarlo, está por defecto, está por defecto, está automático, y hasta el día de hoy Anthropic es el que lo maneja. Ok, y hay un concepto adicional porque claro, tú mandas una cantidad de tokens, eso se guarda en el caché, y la pregunta es por cuánto tiempo lo guardo, por 5 minutos, por 1 hora, por 2 horas, etcétera. Y hay 2, hay al menos 2 configuraciones, son o solo 5 minutos, es decir Yo escribo tokens, los guardo en el caché, los guardo 5 minutos y una vez que eso termina se corta y se elimina, es decir, no se va a volver a reutilizar y cada vez que se reutiliza se vuelve a crear el generativo.

26:26 Nolan Gaete: Por completo.

26:27 Jonathan Vásquez: Ese tiempo se llama el TTL, que es el— me da mucha risa porque es como el tiempo a vivir, el tiempo a vivir de esa cantidad de tokens ya procesados. Hasta más o menos abril se sabía o se intuía, si uno busca por internet se sabía que era de 1 hora en lo que guardaba Anthropic. Pero después de abril y al parecer los distintos testeos que han hecho, al parecer lo bajó a 5 minutos. Entonces ahora tiene guardada la información que tú creas como caché durante 5 minutos. ¿Eso qué implica? Que eso aumenta la cantidad de gasto que tú vas a ver en tus chats.

27:03 Nolan Gaete: Claro, si trabajaste algo y después, no sé, te distrajiste con tu correo y después volviste y le volviste a mandar, ya el caché murió y reprocesó todo.

27:14 Jonathan Vásquez: Sí, reprocesa nuevamente todo. Y igual eso es importante saberlo porque eso significa que si yo estoy constantemente trabajando el caché es algo que lo puedo utilizar a mi favor. El problema es que no sé cuánto ni cómo se sabe porque los estudios que se han hecho es que esto te puede ahorrar entre 40% a 80% del gasto de la cantidad de tokens, es importante porque piénselo que cada vez que envío un nuevo mensaje toda esa información ya la procesé de toda la información del chat anterior entonces pa' qué la tengo que procesar de nuevo, puedo usar el caché. Aquellos que eventualmente dejan ahí corriendo y después se van y vuelven en media hora más, quizás no están siendo eficientes en ese sentido.

27:48 Nolan Gaete: Buen punto.

27:50 Jonathan Vásquez: ¿Y cómo diferencia uno? Bueno, va variando. Generalmente, a medida que más mensajes se va haciendo, se van agregando a la información, o sea, digamos, al chat, más ahorro hay respecto al caché. Y ahí dejo una tabla. Por ejemplo, cuando ustedes envían el primer mensaje y esto se guarda en el caché, no hay información, o sea, no hay un ahorro todavía. Recién el ahorro está del segundo mensaje. Ya cuando envío un segundo mensaje, aproximadamente un 32,5% uno se puede ahorrar ya de los tokens utilizados. Ya cuando voy en el quinto mensaje enviado dentro del mismo chat, esto aumenta un 67%, y así hasta llegar, por ejemplo, hasta los 20 mensajes es un 84,2%. Entonces también ténganlo en consideración que existe esta herramienta, pero está asociada a que sea algo constante.

28:38 Nolan Gaete: Si ustedes se van y se bajan La conclusión es como si empezás a trabajar con Claude, sigue trabajando con Claude, concéntrate en Claude.

28:44 Jonathan Vásquez: Sí, es un poco el mensaje para aprovecharse de esto. Claro. Así que ese es el segundo tip. Sáquenle provecho al caché que tiene Claude para el uso de los tokens.

28:58 Locutor: Hoy, si tu negocio no aparece en Google, no existe para tus clientes. Y sin una web propia, eso es exactamente lo que pasa. Pero claro, sabemos que montar un sitio suena muy técnico, caro y lento. El plan ilimitado de Hostinger te soluciona eso y te da todo lo que necesitas para crecer sin límites. Con servidores globales, tu página cargará rápido en cualquier parte del mundo. Al contratar el plan ilimitado por 1 año, tendrás correo profesional, certificado SSL y podrás alojar hasta 50 sitios web con ancho de banda ilimitado. Además, incluye dominio gratis durante el primer año de servicio. Todo en un solo plan. ¿Lo mejor? No necesitas saber de programación. Puedes construir tu sitio con inteligencia artificial. Solo debes describir tu negocio y la IA de Hostinger generará tu web completa en minutos. Además, al ser un hosting gestionado, Hostinger se encarga de la seguridad del servidor, los respaldos automáticos y, si usas WordPress, también lo mantiene actualizado. Y si quieres vender en línea, el plan incluye tienda ecommerce integrada. Y si ya tienes una web, la migración es gratuita. Si quieres tu sitio profesional funcionando desde hoy, escanea el QR que está en pantalla y obtendrás un 10% de descuento en tu plan utilizando el cupón EVO antes de finalizar tu compra. El link y el código lo encontrarás abajo en la descripción de este episodio.

30:23 Nolan Gaete: Tú mencionaste también que dentro del context que mostraste ahí en pantalla están tus skills, tus MCP, etcétera, etcétera. Y tú dices desactiven los skills que no los van a usar. ¿Cómo lo desactivo?

30:36 Jonathan Vásquez: Muy buena pregunta, mi querido Watson. Excelente. Ahí está lo que es la personalización de tu Claude. Entonces, la personalización de Claude básicamente ocurre en la sección de personalización del settings de tu Claude. Y ahí tú puedes configurar las skills, algunas conexiones que tú puedas tener como MCPs o plugins. Ya, ok, ¿dónde aparece eso? Ya se los voy a mostrar directamente acá. Entonces nos vamos aquí a tu perfil, aquí aparece Settings y se va a abrir esta ventanita. Ya, ya que hay una sección que dice personalización, ahí están las 3, están las skills, los connectors y los plugins. Me voy a ir por ahora solamente a los skills y ahí les voy a mostrar cómo yo puedo activar o desactivar. Yo por ahora las tengo todas desactivadas. Porque le quería mostrar cómo esto podía afectar a mi contexto, ya. Entonces ustedes seleccionan uno, o no, mira, hasta lo tengo. A ver, es que está el skill de Anthropic que tiene que ir sí o sí. Entonces mira, ahí está el importar memoria. Acá hay un botoncito, cada vez que ustedes seleccionan alguna skill, ya, les va a aparecer acá a la derecha este toggle, como este botoncito que tú puedes activar, como interruptor, como un interruptor, claro. Tú lo activas o desactivas y eso va a decir que cada vez que hables una nueva, abras una nueva sesión esta se va a cargar o no. De hecho, hagamos la prueba. Ya déjame ver si es que las tengo todas desactivadas. Aparece, tengo aquí, mira, tengo una skill creada por nuestro gran Elías, nuestro productor. Ahí tengo y algunas creadas por el admin, están todas desactivadas, ya. Y veamos cómo afecta esto en mi contexto, ya. Entonces las tengo desactivadas, voy a crear un nuevo mensaje y aquí voy a poner contexto. Y veamos cuánto el porcentaje que aparece, al menos en las skills, para que veamos cómo nos impacta. Según esto, las skills aproximadamente 1800 tokens, que es un 0,4%. Ok, ya activémoslas todas a ver cuánto nos impacta esto. Y realmente ahora este es un caso muy, muy bajito, es poquito en realidad. Yo ya hice la prueba al momento de activar o desactivar cada una de las skills porque son poquitas las que tenemos. Ya, pero me imagino aquellas personas que empiezan a agregar skills como locos. Démosle nomás, me metí, vi este tutorial y este tutorial dice las mejores skills que tú puedes agregar, claro, y las vayas juntando, juntando, instalemos, instalemos, y tú no tienes una buena gestión de esta. Entonces puede llegar a ocurrir que esta lista, a diferencia de la que yo tengo yo que es bastante cortita, ya puede afectar. Entonces ahí, bueno, activé todas, me voy a ir acá nuevamente y vamos a ver context. ¿Te acordás cuánto eran? 1800 tokens. Ya voy a ponerle play acá. Miren, aumentó casi el doble, aumentó a 3300 tokens solamente al activar aproximadamente 7 skills. Entonces igual no es menor, ya se dan cuenta que va sumando. Ojo que hay algunos plugins, por ejemplo yo tengo un plugin de Vercel que cuando yo lo activo me activa también skills. Claro, entonces tengan cuidado porque hay algunas skills que aparecen y hay alguna skill que no las tengo que desactivar ahí, sino que las tengo que desactivar a través del plugin. Entonces Ahí también tienen que ir gestionando y viendo cómo esto lo pueden ir mejorando. Pero ahí respondería a tu pregunta de cómo activar o desactivar las skills.

33:50 Nolan Gaete: Sí, está respondida. Muy bien, muy bien.

33:52 Jonathan Vásquez: Entonces ese es como ya el tercer tip, ¿o no?

33:54 Nolan Gaete: O el tercer tip, exactamente. Lo siguiente es, yo creo que sería entrar derechamente a los modelos, porque yo creo que ya todos se dieron cuenta que en la parte baja derecha de la zona de prompts uno puede escoger el modelo y ahí tenemos distintas obras literarias. Tenemos Haiku, tenemos Sonnet, tenemos Opus y tenemos a Fable. Nuestro famoso Fable que fue baneado, después fue puesto de nuevo, después que estaba en los planes, después que no estaba en los planes. Ha tenido varios cambios este Fable. Y claro, el administrar tus tokens también van en administrar el modelo correspondiente a tu tarea.

34:38 Jonathan Vásquez: Exactamente. Que algo que dice igual es difícil en un principio ya, pero ¿cómo puedo usar? ¿Cuándo tengo que usar Fable? ¿Cuándo tengo que usar Haiku? ¿Cuándo tengo que usar Sonnet? No es una pregunta trivial, o sí es una pregunta trivial. ¿Hay algo así como que te diga en yo creo que para este tipo de tareas te debo usarlo?

34:56 Nolan Gaete: No es tan trivial, pero hay algunos algunas guías generales, por decirlo de alguna manera.

35:02 Jonathan Vásquez: Ya.

35:03 Nolan Gaete: Haiku es el modelo más rápido, pero también es el más limitado, por decirlo de alguna manera, en cuanto a quizás razonamiento. Ok, pero es súper bueno para el trabajo de full texto. Es decir, si voy a traducir algo, si voy a resumir un texto que voy y copio en el chat, lo pego y enter, o si es que no sé, voy a escribirle la respuesta a alguien con un correo, Haiku es más que suficiente, no necesitáis nada más. Y Haiku es harto más barato que los otros modelos.

35:40 Jonathan Vásquez: No, bastante más. Bueno, y después tenemos una tablita, se la vamos a mostrar, pero sí es mucho más barato.

35:44 Nolan Gaete: Ya, si ya ahora no solamente es texto, sino que es una tarea, es realmente una actividad que tiene que hacer, y estás adjuntándole, no sé, un par de PDF, o le estás adjuntando un archivo de Excel para que te lo analice, o quieres que haga una presentación, Y ahí inmediatamente saltamos a Sonnet. ¿Por qué? Porque además de trabajar bien con texto puede trabajar también mejor con las herramientas, que son justamente todas estas habilidades que tiene que activar para poder responderte bien la tarea. Y la verdad es que con Sonnet en un día de trabajo normal es más que suficiente para casi el 90%. Estoy tirando un número al azar, pero Estoy exagerando, es como la mayoría de tu día con Sonnet lo puedes cubrir perfectamente.

36:33 Jonathan Vásquez: Tengo una pregunta ahí que probablemente también en la audiencia existe, porque tú hablabas de que Haiku era como, tenía menos razonamiento. Claro, en su momento gente quizás todavía no ha llegado hasta acá al nivel. Todos tienen distintos niveles de razonamiento, ¿no? Claro, Haiku como Sonnet, ya no existen los modelos que no son razonadores.

36:54 Nolan Gaete: No, de hecho me acuerdo quizás en primeros capítulos que hicimos del podcast, que tú mismo explicaste. No, si ustedes quieren que piense un poco más, estaba el chain of thought.

37:05 Jonathan Vásquez: Exacto.

37:05 Nolan Gaete: Y había que decirle oye, piensa paso a paso. Bueno, y todas esas técnicas de prompting ya pasaron, digamos, a la prehistoria en términos de la IA, porque ya todos los modelos vienen con al menos una parte de razonamiento, un par de tokens que se queman que no llegan a ti, que es justamente para ir siguiendo una línea lógica para poder responder mejor a las consultas del usuario.

37:31 Jonathan Vásquez: Claro, porque antes la decisión era más fácil en el sentido de que sabía un modelo que quería que yo no razonara, ok, uso este modelo. Pero si quería que un modelo razone, es decir, piensa antes de responderme, estaba este otro modelo. Pero ahora ese criterio ya no existe porque tanto el más rápido ya incluso tiene distintos niveles de razonamiento Y ahora el que, y bueno, claramente los que son más complejos también tienen distintos niveles de razonamiento, pero eso ya es un estándar.

37:57 Nolan Gaete: Sí, pasa a ser un estándar dentro de la actualidad de la IA.

38:02 Jonathan Vásquez: Súper.

38:03 Nolan Gaete: Y ya si es que lo que quiero hacer es una planificación de varios pasos donde podría haber, no sé, quizás varias restricciones, o quizás es, no sé, un Excel que es muy complejo porque tiene muchas fórmulas y links entre las páginas, etcétera, etcétera, quizás ya estoy recién pensando en utilizar Sonnet. Y ahí ya llego como al límite de lo que entrega la mayoría de las licencias, de lo que uno paga como el fee fijo, estos $20 o $100, bla, bla, ya con, llego hasta Opus. Ahora bien, ¿es una tarea que ya Opus no pudo resolver o es una tarea muy compleja de harto tiempo de trabajo? Porque no solamente es planificar, sino que es realizar cada uno de esos pasos, y cada uno de esos pasos quizás tiene subpasos, y cada uno de esos también tiene distintos recovecos donde podría salir la solución. Y ahí recién me paso a Fable, porque claro, Es espectacular. Yo lo he probado y resuelve. Uno le da una instrucción y lo resuelve, y lo resuelve bastante bien a la primera. Pero así también te cobra.

39:21 Jonathan Vásquez: Sí, eso era lo que te iba a comentar. ¿Ese Fable está dentro de la ventana del budget del presupuesto que nosotros vimos de las 5 horas y del semanal, o está aparte?

39:31 Nolan Gaete: Para las, por lo menos las licencias, bueno, para la gratuita no está.

39:36 Jonathan Vásquez: Definitivamente no existe la gratuita. No existe la gratuita.

39:39 Nolan Gaete: Y la de $20 o $25 que pagan Teams tampoco está. Hay que ponerle un presupuesto aparte. Ahí lo puedes activar, pero es dinero que tú tienes que colocar adicional dentro de tu plan. Y ahí hay que poner la tarjeta de crédito y rezar para que no te la reviente con la tarea que le mandaste a hacer. Ok, ahora los Max y la de $100 y la de $200 sí tienen acceso a Fable dentro del plan. Pero claro, dado lo caro que es, también consume mucho más rápido este límite de 5 horas o de la semana que nosotros habíamos hablado antes.

40:18 Jonathan Vásquez: Sí, oye, ¿y hay como una comparación entre, mira, Sonnet gasta 3, 4, 5 veces más que Haiku o así sucesivamente? ¿Existe como esa comparación?

40:29 Nolan Gaete: Sí, de hecho está en la siguiente lámina que tú tienes ahí disponible. Claro, pensando en Haiku como la base, Sonnet pasa a ser 3 veces más caro.

40:43 Jonathan Vásquez: Ok.

40:45 Nolan Gaete: Opus pasa a ser 5 veces más caro que Haiku. Que Haiku. Por eso Haiku es la base. Haiku como base, Sonnet es 3 veces más caro que Haiku, Opus llega a ser 5 veces más caro que Haiku y Fable 10 veces más caro que que Haiku. Entonces no es simple decir, ok, me voy con Opus porque me lo va a resolver, porque en una de esas te puedes equivocar primero 9 veces o al menos 5 veces con Haiku y después, ah, ya no lo hizo, me voy con Opus. Entonces te sale más barato ir casi de a poco subiendo en el modelo si es que realmente no está resolviendo tu problema.

41:26 Jonathan Vásquez: Se me ocurrió una pregunta acá que ahora que es tema que no la tenemos acá en la diapositiva, pero que es la siguiente: yo necesariamente tengo que escoger, o si tengo una tarea, entonces me voy derecho por Haiku, o me voy derecho por Sonnet, o me voy derecho por Opus. ¿No existirá alguna estrategia en que yo diga, sabéis que primero voy a hacer esta parte con Sonnet y después me voy a ir con Haiku o con Sonnet?

41:50 Nolan Gaete: Claro, de hecho hay el tema de la planificación. Si se acuerdan, yo dije con Opus es súper bueno planificando varios pasos para poder llegar a un, a un objetivo. Entonces tú le podrías pedir a Opus, oye, mira, lo que yo quiero desarrollar es esto, ayúdame.

42:09 Jonathan Vásquez: Y va a ir viendo, le puedes planificar qué paso a paso debería hacer para poder desarrollar esta tarea.

42:15 Nolan Gaete: Si hay algo ambiguo o alguna información que te falta, bueno, analízalo y pregúntame. Y de esa manera vamos a hacer quizás un plan de 20 pasos bien definido de qué es lo que tenemos que hacer y de ahí vamos al junior. Pues si ya tenemos lo que, lo que tenemos que hacer y ya vamos a Sonnet que haga la tarea, pidámosle al senior, al consultor senior, que planifique, que piense, que razone todo lo que necesita y después ya cuando sabemos qué hacer exactamente vamos al junior y que haga la tarea.

42:43 Jonathan Vásquez: Una buena simulación. Claro, es efectivamente los seniors te cobran más por hora pero te dicen que en 5 minutos te la tienen listo. Entonces claro, oye, dame tu recomendación y entonces después la pasas al junior porque es aparato que la esté ejecutando, que esa ejecución puede ser más larga incluso también.

43:00 Nolan Gaete: Exactamente. Y ahí ya empezamos a justamente a balancear, a malabarear entre los distintos modelos que nos permite Claude de una forma un poquito más eficiente.

43:13 Jonathan Vásquez: Entonces es igual, es una buena estrategia. Ahí ya estamos como en el cuarto y quinto tip, que de hecho lo estuve pensando y dije, uy, esto no lo agregamos. Entonces es un tip interesante que yo también lo utilizo. Siempre hay un modo, ojo, por si acaso, /plan. Hay un modo de plan, de planificación dentro de Claude, está en Claude Code. Ustedes lo pueden hacer /plan y le dice voy a planificar. Entonces este ya está pensado, ya está ese comportamiento preconfigurado dentro de Claude. Entonces podrían partir primero con el modo plan y una vez que el plan está listo lo ejecutan, se cambian de modelo y lo ejecutan con otro modelo. Entonces es una muy buena estrategia de eficientar Va a ser más eficiente el uso de los tokens. Uy, acá hay una comparación de los costos en realidad.

43:53 Nolan Gaete: Sí, esto ya es no en el uso de token, pero puede ser en el uso de tu límite, pero puede ser básicamente equivalente. El más caro va a ocupar más de tu límite donde tenemos una tarea sencilla de traducción, como yo les dije, full texto y Haiku, Sonnet y Opus obviamente lo resuelven sin problema. Pero Haiku salió 9,9 centavos de dólar, Opus salió 77 centavos y la verdad que la diferencia en calidad es cero.

44:27 Jonathan Vásquez: En una tarea sencilla de traducción. O sea, igual a priori si yo quiero pedirle traducir, no sé, si iría por Opus a priori una vez. Lo que pasa es que la traducción dentro de los LLM es un problema que se viene solucionando desde antes de los LLM, entonces—

44:42 Nolan Gaete: Sí, del estudio de los NLP y de hecho Google Translate hace cuánto existe y hacía no un excelente trabajo, pero te servía como para entender un documento.

44:52 Jonathan Vásquez: Sí, entonces claro, ahí tiene sentido aplicar inmediatamente Haiku, claro.

44:56 Nolan Gaete: Y de ahí nosotros vamos a ir subiendo dependiendo de la complejidad de la tarea hasta llegar quizás a una de mediana complejidad donde claro, Haiku ya definitivamente vamos a pagar por él, pero no nos va a dar ningún resultado.

45:09 Jonathan Vásquez: Claro.

45:10 Nolan Gaete: En cambio, ya Sonnet y Opus obviamente sí. Pero seguimos viendo que Sonnet es 1 punto, perdón, Opus es 1.5, 25 veces más caro que Sonnet sin mucha diferencia de calidad. Es decir, todavía me sirve Sonnet y resuelvo el problema sin ningún problema y me ahorro tokens y todo el límite.

45:30 Jonathan Vásquez: Aquí igual la recomendación para la audiencia es que, puta, pero no es como una receta de qué tarea tengo que usar para Haiku, qué tarea usar para Sonnet u Opus. Yo creo que la mejor recomendación es, claro, tú puedes encontrar recetas, pero es que los contextos son tan variados entre organizaciones y entre empresas o en tu contexto laboral, que yo creo que lo mejor que puedes hacer es que tú pruebes y ojalá tengas un set de tareas definidas donde tú sabes cuál es la pregunta y cuál es la respuesta esperada. Entonces pruébalo. Con Haiku tengo este resultado, con Sonnet tengo este resultado. Es decir, este ejercicio que nosotros estamos mostrando acá en la diapositiva, que la hicimos de manera interna, Idealmente que ustedes también hagan lo mismo en sus casas. Entonces, la invitación es que tengan este conjunto de tareas para probar cuál es el mejor modelo para cada una de las distintas tareas que tengo.

46:19 Locutor: ¿Sientes que todos hablan de inteligencia artificial, pero tu empresa aún no la aprovecha? En EvoAcademy te ayudamos a llevar la IA a resultados reales con nuestros cursos para empresas. Estos cursos son actualizados, personalizables y aplicados a tu trabajo. Por ejemplo, nuestro curso IA para los negocios es ideal para equipos que están explorando el potencial de esta tecnología, mientras que nuestros cursos de Claude, Gemini, ChatGPT y Copilot están pensados para quienes quieren aprovechar al máximo estas herramientas. Revisa nuestro catálogo completo en evoacademy.cl/cursos-corporativos o en el enlace que encontrarás en la descripción de este video.

47:04 Jonathan Vásquez: Relacionado con el uso de los distintos archivos. Entonces, ¿qué pasa si, por ejemplo, yo tengo un conjunto de tareas que a cada roto utilizo siempre los mismos archivos? Es decir, probablemente puedo tener, ya pues yo soy académico, soy profesor, hago clases, entonces generalmente siempre voy a tener el mismo programa del curso como parte del contexto. Probablemente voy a ir agregando poco a poco cada vez más slides de las que voy creando. Entonces le voy pidiendo al modelo que, o a Claude, Claude Cowork puede ser que me está ayudando a generar material, pero siempre hay como un conjunto base de instrucciones que son bases siempre dentro de un mismo contexto. Y en ese sentido no tiene mucha lógica que a cada rato que abra un chat le va a cargar todo de nuevo y empieza a generarlo, las consultas. Y aquí nos propone una solución, ¿no? Una solución que le llamó proyectos.

47:56 Nolan Gaete: Así es.

47:57 Jonathan Vásquez: Entonces no sé si nos puedes contar qué son los proyectos. ¿Y cómo solucionas este problema que te planteé acá?

48:03 Nolan Gaete: Los proyectos es, por decirlo de alguna manera, cualquier chat que tú comiences dentro de ese proyecto va a tener un contexto base. Es decir, tú ya mostraste de que de por sí ya hay un contexto base por todo el harness y todas las instrucciones que tiene Claude, cómo funciona. Bueno, aquí le colocas una carga adicional, es verdad, Pero te ahorras tiempo de usuario, más bien, donde no tienes que explicarle todo de nuevo, donde no tienes que subir todos los archivos de nuevo, sino que tú simplemente comienzas este chat, esta interacción con Claude, y ya sabe a qué te refieres porque le subiste la bibliografía, le subiste, no sé, la diapositiva que tú dijiste, le subiste el programa. Y además tiene una instrucción base que pasa a ser como, entre comillas, una instrucción de sistema que también va a ir incluido dentro de tu chat.

48:59 Jonathan Vásquez: Entonces, para que la gente se vea en sus casas, esta parte aparece arriba a la izquierda. De hecho, bueno, yo les voy a— acá les muestro un zoom. Básicamente estoy mostrándole acá en pantalla donde ustedes tienen arriba el home y seleccionar la opción de code, pero bajito, antes de hacer clic en agregar un nuevo chat, te da la opción de agregar proyectos. Y la agregación de esos proyectos, ustedes hacen clic ahí y les va a preguntar lo que dice Nolan, pues te va a preguntar cuál es el nombre de este proyecto, te va a preguntar para qué o cuáles son los tipos de archivos que tú vas a utilizar. De hecho, la gracia también tiene que tú le puedes indicar una carpeta dentro de tu computadora, claro. Entonces cada vez que agregues nuevos archivos, eso se va a sumar a tus archivos bases cada vez que abras un nuevo chat, ya. Entonces tú creas eso, les da la carpeta de los objetivos, pero adicionalmente tiene otras dos opciones que se crean una vez que se hace el proyecto. Hay que decir, tú creas el proyecto, le agregas este archivo bases, y ahí están las instrucciones, que eso te aparece acá a la derecha. Tú agregas las instrucciones y agregas además algo que se conoce como la memoria. ¿A qué se refiere con la memoria? Es con instrucciones eventualmente. Por ejemplo, yo puedo estar, a ver, los LLM o los conceptos, estos tipos de modelos que están por detrás son lo que se conoce como stateless. Eso quiere decir que son estados que no se mantienen durante el tiempo. Entonces, ¿a qué se refiere con eso? Es que si yo tengo una conversación con él, con Claude, cierro ese chat y después voy a abrir un nuevo chat, todo lo que conversamos en el chat previo no lo recuerda. Claro, ese estado no aparece. No, no es como ahora Claude conoce si ya conversamos, entonces debería saberlo. No, no, no funciona así. Entonces, ¿qué luego ocurre? Existe el concepto de la memoria donde Claude va decidiendo qué información es relevante guardar para que a la siguiente sesión yo esto lo tengo que recordar. Cosas como cuál es tu nombre, qué estás haciendo, de qué se trata el proyecto. O piénsenlo así, por ejemplo, el caso de mis clases. Entonces cada vez que yo tengo un nuevo chat, ya yo le voy pidiendo, incluso le puedo pedir, oye, guarda esto en la memoria, guarda esto en la memoria para las siguientes conversaciones, las siguientes clases que vamos a hacer. Así yo lo tengo en cada uno de los chats que voy abriendo en este proyecto. Estoy creando un nuevo material y quiero que esta información que acabamos de crear Claude la guarde, le puedo pedir guárdalo en la memoria o de alguna otra manera lo va a decidir de manera automática qué información guardar del chat para las siguientes conversaciones que tengamos en este mismo proyecto.

51:21 Nolan Gaete: Exactamente. Una acotación adicional a los proyectos, existen dos tipos de proyecto por decirlo de alguna manera, las dos funcionan igual, la diferencia es dónde se guarda.

51:32 Jonathan Vásquez: Buen punto.

51:33 Nolan Gaete: Cuando tú tienes un proyecto con una carpeta local, ese proyecto definitivamente es local, funciona solamente en tu computador, no lo puedes compartir. La ventaja que tiene, eso sí, obviamente, usar la memoria de tu computador, el disco duro de tu computadora. Entonces no va a tener ningún límite más que el que tú tengas físicamente en tu computador del disco duro. La otra alternativa es tener un proyecto online donde va a tener la facultad de poder compartirlo con otras personas. Así que cualquiera lo puede utilizar. También le puedes subir archivos, pero ahí sí tiene un límite de cuántos archivos, o más bien el tamaño de los archivos que puedes subir. Y ahí va apareciendo una barrita que se va llenando hasta llegar a su límite, donde ya no puedes subir ningún otro archivo.

52:22 Jonathan Vásquez: ¿Y hay una diferencia entre usar Chat o Cowork?

52:24 Nolan Gaete: En la documentación no está tan explícito, pero en los experimentos que yo he hecho, cuando usas un proyecto online es mejor utilizar chat. Y si tienes un proyecto local, ahí puedes utilizar Cowork.

52:37 Jonathan Vásquez: Igual yo he tenido la experiencia también que en el caso que es local, a mí no me permite usar chat. De hecho, les muestro acá en pantalla. Acá este es un, perdón, este es un proyecto que teníamos para un cliente que estábamos trabajando. Por ejemplo, si yo quiero hacer clic sobre chat, me dice chat no está disponible para los proyectos locales. Entonces está solamente Cowork. Entonces me imagino que en el caso en que sea online, chat está disponible pero no Cowork.

53:05 Nolan Gaete: Cowork te lo deja seleccionar igual.

53:07 Jonathan Vásquez: Ah, te lo deja seleccionar igual.

53:09 Nolan Gaete: Sí, ese, por eso digo que podría llegar a ser un problema por ahora y lo podrían corregir en cualquier momento.

53:14 Jonathan Vásquez: Sí, la verdad, esto es al momento en que estábamos grabando.

53:17 Nolan Gaete: Claro, entonces dentro de los experimentos que he hecho esta semana, si es online utilicen chat y bueno, si es local, tú dijiste, no puedes utilizar chat, tiene que ser Cowork.

53:26 Jonathan Vásquez: Así es que bueno, nuevo tip es si ustedes tienen algún tipo de trabajo que es constante, hay una base, que esa base eventualmente puede ir creciendo, pero que es importante que se vaya repitiendo, se vaya alimentando en cada uno de los chats, la mejor forma de manejarlo es a través de los proyectos.

53:44 Nolan Gaete: Exactamente.

53:45 Jonathan Vásquez: Y hablando sobre archivos bases, también hay algunos tips de ciertos formatos. Lo que hemos nosotros identificado es que hay ciertos formatos que los modelos al momento de procesarlo ocupan menos tokens que otros. Exactamente. Entonces, por ejemplo, podemos tener una tabla en un Excel o podemos tener una tabla, esa misma tabla la podemos guardar en un archivo plano como TXT o hay un formato que se está haciendo más famoso el día de hoy, al momento en que estamos grabando esto, no sabemos si va a ser a futuro, pero yo recuerdo al inicio esto no era tan utilizado. Claro. Que es el famoso Markdown, que son un tipo de enriquecimiento de texto plano que permite indicarle al modelo, muy parecido así como etiquetas XML, pero hay ciertos símbolos que el modelo entiende que se refieren a un título, que se entiende que esto es negrita, que estos son bullet points, que esto es una tabla, por ejemplo, y que al momento de ser un formato más de estilo texto plano cuesta mucho menos, o la cantidad de tokens que utiliza es mucho menos que si lo usáramos, por ejemplo, a través de un PDF o a través de un Excel. Ya, ejemplo, les muestro en pantalla dos, un caso de una muy sencillo, de una tabla que yo la estoy subiendo como PDF o de una tabla que yo la estoy procesando como Markdown. Si yo se la entrego como un archivo Markdown cuya extensión es .md, ya, el PDF al procesarlo gasta aproximadamente 736 tokens, ya, pero la misma tabla en formato Markdown en un archivo .md gasta 156 tokens. Ya, entre 5 a 6 veces menos que el caso del PDF. Entonces, si usted tiene información, igual el mensaje acá, si usted tiene información en PDF, en un archivo Word, trate de pasarlo primero a Markdown, y después de que lo pasa a Markdown lo carga. ¿Cómo lo puede hacer? Métase a las aplicaciones gratuitas de ChatGPT o Gemini. Oye, pásame esto a Markdown, por favor, y te va a crear su canvas, y ese canvas te va a crear en Markdown, tú lo descargas como Markdown y después te vienes a Claude y lo cargas.

55:48 Nolan Gaete: Claro, ahí obviamente el alcance de por favor hagan eso, pero no con información sensible o privada de la empresa, etcétera, etcétera. Claro, hay que decirlo, hay que decirlo.

55:59 Jonathan Vásquez: Ese es un buen punto.

56:00 Nolan Gaete: Ahora, ¿por qué sucede esto? Esto es bien simple. Los archivos de texto plano, con suerte, en lo que se llama la metadata, lo que define el archivo, no su contenido, es con suerte como ¿Qué tipo de letra está ahí usando? Fin. En cambio, si subes una imagen, un PDF, un Excel, está definiendo, oye, ¿qué son las celdas? ¿En qué palabra está? ¿Cuál es el formato? Entonces hay un set de texto que está ahí que no lo ve el usuario porque al final eso se traduce en interfaz simplemente, o cómo lo tiene que leer la aplicación de PDF, que obviamente ocupa esta cantidad de tokens adicionales. Entonces por eso es que cuando lo pasamos a texto plano es mucho más económico, por decirlo de alguna manera.

56:46 Jonathan Vásquez: Exactamente. Y si quieres hacer un texto plano enriquecido, Markdown. Esa es la gracia. Markdown, que es el que hemos encontrado que además los modelos lo procesan bien. Ese es el punto. Además los modelos lo pueden procesar bien. Ya.

56:57 Nolan Gaete: Sí.

56:58 Jonathan Vásquez: Oye, llevamos hartos tips.

57:00 Nolan Gaete: Llevamos, sí, llevamos bastantes tips. Yo creo que ya estamos llegando más o menos al final y aquí vienen yo creo que 2 tips que son Bien chistoso o bien anecdótico, por decirlo de alguna manera. El primero es el del horario. ¿Cómo eso del horario? ¿Qué encontraste por ahí?

57:18 Jonathan Vásquez: Sí, mira, cuando estaba preparando el capítulo de hoy día encontré por ahí que mucha gente recomendaba sobre no usar Claude en los horarios peaks porque te cobran más. Yo dije como, ¿dónde? ¿Cuándo? ¿En qué momento Anthropic dio el aviso de esto, que efectivamente cobran más caro. Es como en la autopista. Bueno, este es el contexto chileno. En Chile, a nosotros cuando usan la autopista, la autopista es más cara, el tag es más caro para incentivar que no usen la autopista. Entonces, ¿qué es lo que hace Claude? Algo muy parecido, es como mira, en este horario hay demasiadas consultas que nos hacen, entonces vamos a cobrar mucho más caro el uso de los tokens. Por tanto, un token te puede salir más caro dentro de tu budget, por así decirlo, y te va a fumar y te va a comer más rápido el presupuesto de tokens que tú tienes. Personalmente, quizás no hice la búsqueda lo suficiente pero no encontré nada oficial, así como dijera vamos a empezar a cobrar más caro. Sin embargo, sí llegué a un tweet de un trabajador de la empresa y aquí oficial, el tipo oficial que se llama, no sé la pronunciación, Thariq Shihipar, donde posteó que efectivamente ellos iban a aplicar un costo o iban a cobrar mucho más caro el uso de los tokens para ciertos horarios, pero principalmente el de las 5 horas. Esto no aplicaba a las semanales, esto aplicaba a la de las 5 horas, la ventana de 5 horas. Entonces, en cierto horario, dado que hay un peak de uso, te van a cobrar más caro. Ya, ¿cuáles son esos horarios? Entre las 5 AM y 11 AM de Pacific Time. Ahí ustedes tienen que ver cuál es el horario que le corresponde a su país. Y entre las 1 PM y las 7 PM de GMT. Ahí ustedes tienen que trabajar.

59:01 Nolan Gaete: Además cambiar la zona horaria.

59:03 Jonathan Vásquez: Sí, son los 2 horarios, horarios para orientales y horarios para americanos y europeos. Entonces, ¿cuál es el incentivo acá de no utilizarlo? Ahora, cuánto más tú utilizas, cuánto menos tú utilizas, no lo sabemos. Hay ciertas como intuiciones, si tú te metes a Reddit te puedes encontrar que te cobra tanto, tú puedes escoger. Pero hay documentación de gente que ha hecho los testeos y efectivamente es así, ya. En este horario te cobra más, así que eventualmente tengan cuidado. Lamentablemente no les podemos decir acá un número, me gustaría hacerlo como lo hemos hecho durante todo el capítulo pero no encontré un número oficial, así que prefiero quedarme de que el mito o lo que se decía efectivamente es así, ya, y está publicado por un trabajador de Anthropic directamente. Interesante de que le hayan permitido al trabajador hacerlo y que la empresa no lo haya querido hacer claramente. Yo creo que si la empresa dice vamos a empezar a cobrar más en esta hora, es como queda la escoba. Entonces dijeron ya lo vamos a lanzar por otro camino. Interesante estrategia de comunicación.

1:00:06 Nolan Gaete: Sí. Y ya llegando a lo último, ¿cuáles son los 4 puntos que encontraste que podría ayudar a las personas a ser más eficientes con el uso de sus tokens?

1:00:17 Jonathan Vásquez: Sí, mira, hay una cantidad de distintos otros tips, bien, que sería interesante. Los voy a dejar aquí en pantalla para que la gente, la invitación a que testeen, revisen y lo comprueben. El primero de ellos es si tienen ciertas tareas que son recurrentes, ya que le van a pedir a Claude que lo haga. Bueno, utilicen las herramientas como scripts. Ya scripts es un archivo que lo que hace Claude es que lo va a tomar, lo va a ejecutar. Puede ser, por ejemplo, algún archivo de Python, claro, que ejecuta la tarea que es automática y repetitiva. Y en vez de que escriba el código, lo vuelve a ejecutar.

1:00:51 Nolan Gaete: Acá lo ejecuta, lo manda, lo ejecuta y espera la respuesta.

1:00:55 Jonathan Vásquez: Y eso claramente no te va a utilizar nada de token para escribir nuevamente el script, para ahora ejecutarlo y para ahora nuevamente leerlo. Entonces utilicen scripts o utilicen las herramientas que las que pueda tener Cowork. Ya, perfecto. La segunda es que, como ya saben, que cada vez que ustedes envían un nuevo chat, que en cada envío va siempre acumulándose la cantidad de información que ya está cargada en el chat, no hagan esto de le mando una pregunta, respuesta, voy a la segunda pregunta, recibí la primera respuesta a mi primera pregunta, entonces voy a mandar un nuevo chat, un nuevo mensaje con la segunda pregunta. Claro. Entonces, porque ahí, ¿qué pasa? Estoy mandando el chat historial más la que recibí de la primera. Claro. Entonces estoy mandando 3 veces la misma información cuando eso lo puedo reducir en una sola, en un solo mensaje y mandarle las 3 preguntas. Entonces, si tienen más de una pregunta, no crean que el modelo no va a ser capaz de hacerlo. No, hoy día los modelos son capaces de poder identificar tareas complejas, planificar e ir viendo cómo responder si son varias preguntas.

1:01:58 Nolan Gaete: Claro.

1:01:58 Jonathan Vásquez: Entonces, la recomendación acá, si tienen varias preguntas, mándenlas todas de una. Ahora, ¿cuál es ahí la tarea? Ser ordenado.

1:02:05 Nolan Gaete: Exacto.

1:02:05 Jonathan Vásquez: En darle bien el prompt de esta es la pregunta, revísala acá, revisa, etcétera. Ya tenemos ahí en el mismo capítulo, en este mismo, perdón, en capítulos previos tenemos de cómo hacer un buen prompt. Entonces revisen ese capítulo y eso les va a ayudar a cómo puedan construir mejor todas las preguntas que tengan y enviarlas en un solo mensaje. El tercero es que, bueno, lo dije al principio, saber utilizar /compact, /clear. Compact recuerden que es para si ustedes tienen mucha información y hay una tarea que quieren seguir, o sea, hay una tarea que ya la terminó O utilizan clear para limpiar todo el chat y así no sigan utilizando la ventana de contexto y se van a cambiar a una nueva tarea. O eventualmente, si están viendo que ya están llegando a su ventana de contexto final y hay demasiada información cargada, bueno, utilicen /compact para compactar esa información y así reducen su ventana de contexto. Entonces los siguientes mensajes usan menos tokens de los que debería utilizar si no utilizan compact. Y la cuarta y final, que está principalmente, está para Claude Code, que hay muchos plugins y herramientas creadas por la comunidad que trata de buscar disminuir el uso de los tokens. Y aquí yo busqué algunas que— sí, hay muy chistosas. Aquí yo busqué las que son como más recomendadas, las que yo me metí como a los repositorios, la cantidad de gente que lo ha— bueno, es que en GitHub está hasta el de la estrellita, que tú pones la estrellita y lo guardas dentro de tu proyectos. El primero es el Ponytails, que de hecho yo los invito a ver por qué Ponytails, es porque se refiere, es muy estereotipado, de un programador típico que tiene pelo largo y toma su colita. El objetivo de esta herramienta, de este plugin, es que tú lo conectas a tu Claude Code, es generar código eficiente. De hecho, el mensaje dice como el tipo es como típico este programador, o sea, no típico, probablemente es un estereotipo, estereotipo de un programador que tiene el pelo largo, que se toma su colita y que es seco escribiendo código. A ver, seco lo usamos en Chile como experto. Claro, son muy, muy buenos, es muy bueno escribiendo código. Entonces este, este plugin permite generar código eficiente y muestra, ellos hacen distintos experimentos y muestran que puede bajar hasta desde el 54% menos de código creado hasta incluso el 94% menos en los que ellos han mostrado. Y eso también implica el 20% más barato y como se crea menos código, 27% más rápido también.

1:04:32 Nolan Gaete: Claro.

1:04:33 Jonathan Vásquez: Entonces ese es el primero, algo que tú puedes agregar como plugins y creas cada vez código más eficiente. El segundo es el Caveman, ya es como el hombre de las cavernas, que la lógica es muy buena, es muy chistosa porque básicamente aquellos que han trabajado con Claude Code o con Claude es muy verborreico, es decir, como que te habla mucho. Bueno, de repente hay algunas configuraciones que tú puedes modificar eso Pero en general te está conversando y te está contando qué es lo que hizo, lo que encontró, etcétera. Y lo que plantean con este plugin es decir, háblame como hombre de la caverna, como yo escribir código, yo encontrar algo. Entonces me va a decir, mira, revisé el— Working done. Claro, working done. Entonces revisé este trabajo, en vez de que me diga como revisé el archivo tanto y encontré tal cosa, sería interesante que lo puedas revisar, es como Archivo encontrado, problema. Entonces eso es como un poco la lógica, tiene sentido que entonces gasta menos tokens y entrega la información relevante. Ojo, que tanto el Ponytails como el Caveman tratan de mantener la información, es decir, tratan de mantener la exactitud y el desempeño del modelo pero disminuyendo la cantidad de tokens.

1:05:48 Nolan Gaete: Ya, perfecto.

1:05:49 Jonathan Vásquez: En el caso de Caveman, lo que ellos muestran es que genera aproximadamente un 33% menos de tokens. Así que no, es bastante bueno en ese sentido, ya. Y el último es Graphify, ya, que está relacionado con la creación de grafos. ¿Cuál es la gracia de esto? Ellos se basaron en los flujos de trabajo de Andrej Karpathy, que ya hemos hablado de él en este podcast. Para aquellos que nunca lo han escuchado, el creador de GPT-3, era de antes de OpenAI, es considerado una de las eminencias sobre el uso de la inteligencia artificial, bueno, y la creación, no solamente uso. Él crea inteligencia artificial, tiene varios buenos podcast y su trabajo es muy bueno, recomendado que lo sigan. Entonces él mostraba que dentro de su flujo de trabajo dice, mira, todo código o todo programa que uno está creando lo puedes crear como grafo, ya, que básicamente conexiones de entidades, datos, estructuras, pero de una perspectiva como grafo, ya. Y dice, en vez de pasarle todo el código de una para que el modelo sepa qué es lo que tengo y cómo se estructura, le paso un grafo.

1:06:53 Nolan Gaete: Claro.

1:06:54 Jonathan Vásquez: Y eso reduce la cantidad de tokens a utilizar para saber cómo está estructurado mi proyecto.

1:07:01 Nolan Gaete: Claro, porque parte de un punto y dice ya de este punto solamente me puedo ir allá, acá o acá. No reviso todo el código sino que reviso acá, no, no me gustó, por acá, ah sí, aquí está el camino.

1:07:11 Jonathan Vásquez: Por ejemplo, claro, lo que te puede plantear, mira, el modelo tiene, o sea, tu proyecto tiene funciones, tiene módulos, ¿Qué módulos? El módulo A, el módulo B, el módulo C. Ya, ok. Además de los módulos tengo roles. ¿Cuáles son los roles? Roles tanto— Eso es como lo que va haciendo. Entonces tiene una visión mucho más estructurada de las distintas clases o entidades que existen dentro de tu proyecto. Entonces Graphify, ¿qué es lo que hace? Es que tú lo instalas, toma tu proyecto, lo transforma como un grafo. ¿Y cuál es el impacto que finalmente genera en tu proyecto? Es que según el análisis que ya han mostrado es que reduce en un 71% los costos de los tokens que utilizan, que es bastante. Entonces ahí ustedes pueden ir comparando y utilizando una combinación entre Ponytails, Caveman, Graphify. Entonces la invitación es también, así como estos 3 existen, existen muchos más, créanme, hay miles.

1:08:04 Nolan Gaete: Yo encontré con miles y dije, ya, pero están tratando de a ver cómo ahorro tokens para que no me salga tan caro o poder utilizarlo más tiempo, básicamente.

1:08:13 Jonathan Vásquez: Básicamente. Así es que esos son como los otros tips importantes. Hoy hay varios más, porque ejemplo, por ahí no hablamos de artefactos, no hablamos de scheduling también, no.

1:08:24 Nolan Gaete: Hay hartas cosas que si le interesan las pueden dejar en el tintero, pero si lo comentan quizás hagamos un capítulo adicional mencionando esas herramientas que tiene Claude igual para poder ahorrar un poco más de tokens.

1:08:37 Jonathan Vásquez: Exactamente.

1:08:39 Nolan Gaete: Bueno, Jonathan, muchas gracias por traer todos estos tips. Son varios, hay que ver este capítulo varias veces. Yo creo que la gente debería verlo varias veces para poder entender y empezar a administrar mejor sus tokens dentro de Claude. Como dijimos al principio, algunas de estas técnicas también son aplicables a otras plataformas. Por ejemplo, si alguien no está utilizando Codex, Codex también tiene un límite. En ChatGPT Online no se ve tanto, pero en Codex sí se ve.

1:09:10 Jonathan Vásquez: Y que si no es, no tiene ventanas horarias, tiene solo semanal.

1:09:14 Nolan Gaete: Tiene solo semanal, exactamente. Entonces, y al parecer la industria va para allá. Hay hartos rumores de que está súper subsidiado. Entonces no sería raro que otros más, otros proveedores más empiecen a colocar algunos de estos tipos de límite que Anthropic ya partió desde el principio así, si no me equivoco. Así que muchas gracias nuevamente y muchas gracias a ustedes por llegar hasta esta parte del capítulo. Y nos vemos en el siguiente episodio de Inteligencia Artificial para los Negocios. Hasta luego.

Más episodios

Ver todos los episodios