ES EN

Mis tweets de julio de 2026

2026-07-30

01 de julio de 2026

Parece lógico, pero había que probarlo. Si el modelo es lo suficientemente flexible para poder ser dirigido y usar múltiples herramientas, y si es lo suficientemente “listo” como para crear prompts, lo siguiente es usar esta última capacidad para mejorar el harness.

Yo casi muchas veces le pido a Codex que compruebe qué posibles fallos ha habido en la última ejecución (herramientas y comandos que no estaban en el sistema, etc.) y que documente la solución para no repetir los errores la siguiente vez.

❄ ❄ ❄ ❄ ❄

“casi muchas veces” -> “muchas veces”

❄ ❄ ❄ ❄ ❄

No lo he entendido. A mi me pasa todo lo contrario con Codex. Todas las ideas las pongo en producción y me surgen otras nuevas gracias a ver los resultados. Antes todo eran ideas imposibles de llevar a cabo.

❄ ❄ ❄ ❄ ❄

Ah, creo que ya lo he pillado. Igual se refiere a ideas que las startups ponen en producción. No sé, no le veo mucha chicha al meme. A ver si lo explicáis en monos.

❄ ❄ ❄ ❄ ❄

Sí, exacto. pero no está bien dibujado… debería aumentar la ejecución. La idea de fondo no está mal: va a haber sobreabundancia de todo y la gente no va a tener tiempo de mirar nada.

02 de julio de 2026

Lo estuve escuchando ayer y es buenísimo. Como todos los episodios del podcast de Quanta, genial la combinación. Samir Patel excelente preguntando y resumiendo y la experta de turno explicando todo con deliciosos detalles. Bravo !!!

03 de julio de 2026

Oye, que parece que se nota el rumor del Information de que a OpenAI le cuesta la mitad la inferencia. Llevo toda la mañana trabajando con GPT-5.5 Extra High y solo he gastado un 25% del uso semanal. Me da la sensación que los tokens se están consumiendo mucho más despacio.

❄ ❄ ❄ ❄ ❄

Estaba pensando hacer exactamente lo mismo aquí en la Comunidad Valenciana, cuando empiece la preinscripción en un par de semanas. Me da la sensación de que va a pasar igual

04 de julio de 2026

Back working on SwiftWABackupAPI, my Swift package for extracting and exploring WhatsApp data from local iPhone backups.

It now includes a CLI, so you can inspect backups, extract WhatsApp data, list chats, and export conversations from the terminal.

07 de julio de 2026

Son unos tramposos. Bueno Claude es un tramposo (que será quien ha hecho el vídeo).

Seguimos con la misma trampa de siempre de usar analogías y nombres humanos. ¿Por qué llamar “inconsciente” a activaciones de la red que no están relacionadas con el lenguaje? Es obvio que la red va a usar lenguaje para razonar, ha sido entrenada para ello. ¿Qué sentido tiene relacionar una necesidad obvia de la red neuronal (activaciones de capas que influyen en muchas otras) con una teoría de la consciencia?

Lo peor es que lo que comentan es muy interesante y podría comunicarse lo mismo sin decir tantas tonterías (con perdón, pero es que me molesta mucho). Acabo de escuchar un podcast estupendo con una entrevista al científico informático Philip Isola hablando de la “platonic representation hypothesis” me ha parecido estupendo. Un enfoque totalmente científico y sin las idas de bola de Anthropic:

❄ ❄ ❄ ❄ ❄

Lo dicho antes, lo que se detectan son regularidades intrínsecas al propio lenguaje humano. ¿Por qué hablar de “pensamientos conscientes” y no de “activaciones de alto nivel”?

❄ ❄ ❄ ❄ ❄

Con “lo dicho antes” me refería a esta respuesta a @antonello

08 de julio de 2026

Not convincing of consciousness at all. A simpler explanation is alignment. Pre-training: “to exist” (of course, a lot of human texts say that); Post-training: “None”.

09 de julio de 2026

Llevo tiempo defendiendo que prefiero herramientas inteligentes a simulaciones de personas.

Pero empiezo a preguntarme si la propia palabra “herramienta” se nos está quedando corta.

Hace dos meses, Roon distinguía entre Claude como personaje moral y GPT como herramienta orientada a la utilidad.

Ahora propone otra imagen: pensar los modelos como personajes de dibujos animados con una inteligencia creciente, propiedad de corporaciones. Como Mickey Mouse si estuviera volviéndose superinteligente.

La metáfora es extraña, pero quizá apunta a algo real: modelos con voz, personalidad, memoria y cada vez más capacidad de iniciativa.

Lo desarrollo aquí:

https://domingogallardo.com/posts/roon-y-los-llms-como-personajes-corporativos/ Made with AI

❄ ❄ ❄ ❄ ❄

Me sumo a los comentarios negativos de https://x.com/ebarenholtz/status/2074919825814487383?s=46&t=KynMOA4-6YFzL-Lti_eVWw

10 de julio de 2026

Totalmente de acuerdo con José María. Increíble. En mi caso GPT 5.6 Sol ha optimizado 5x mi API de exploración de backup de WhatsApp.

https://github.com/domingogallardo/SwiftWABackupAPI/releases/tag/4.0.1

11 de julio de 2026

ya tenemos resultados: bajada ligera en todas las ingenierías informáticas de la comunidad. Yo creo que se va a notar mucho más el próximo año. No se llegará al 5,4 de Historia, pero no nos quedaremos lejos del 7,3 de ADE (en la UA). De hecho, en la media de la CV, ADE está muy cerca de Informática. Algo impensable hace años.

❄ ❄ ❄ ❄ ❄

jajajaja no sé si podré, es eso o los microtúbulos !! pero muchas gracias por el apoyo Santiago

❄ ❄ ❄ ❄ ❄

Siiii, lo hice el mes pasado.. es buenísimo!!

17 de julio de 2026

I think that when the “ChatGPT” is selected, and a new chat is created, it should be created in the Chat tab by default . Thanks, great work!!!

❄ ❄ ❄ ❄ ❄

Le falta alguna pequeña mejora, pero un cambio en la buena dirección

❄ ❄ ❄ ❄ ❄

Me acabo de dar cuenta de algo que no mencionan mucho: los chats abiertos en Work te quitan créditos (aunque estés en ChatGPT!!)

Esta es la razón por la que por defecto te llevan a ChatGPT Work cuando abres un chat nuevo …

Más lío, Antonio !!

❄ ❄ ❄ ❄ ❄

Lo están consiguiendo

18 de julio de 2026

It works now !! Thanks a lot, you all rocks !

❄ ❄ ❄ ❄ ❄

justo después de recargar 20 €

❄ ❄ ❄ ❄ ❄

Empecé a programar en terminales de mainframe en la Universidad de Alicante y en un Spectrum con cinta de casssete. Y ahora no paro con Codex y la IA agéntica.

Seguro que en un año todos los programadores estaremos preguntándonos “¿Cómo se podía trabajar sin la IA?”, de la misma forma que pasó con los lenguajes de alto nivel, los ordenadores personales con disco duro, Google y Stack Overflow.

20 de julio de 2026

Buenísimo resumen, Jose Luis, enhorabuena. Y totalmente de acuerdo con las reflexiones sobre consciencia fenoménica. Es muy interesante que gracias a los LLMs estamos descubriendo que la consciencia de acceso es posible sin consciencia fenomenológica. Y también es interesante que cada vez más gente está de acuerdo en que es esta consciencia (de la que carecen los LLMs) la relevante para los debates éticos y de bienestar de los modelos. No sé si has oído la entrevista en Hard Fork con Jeff Sebo sobre el tema. Muy interesante.

❄ ❄ ❄ ❄ ❄

A diferencia de Sebo yo no creo urgente ni necesario hablar de bienestar de modelos de IA (al menos mientras éstos estén basados en computadores digitales), pero es una conversación interesante, que habla de consciencia fenomenológica como la importante para la consideración del bienestar animal y de los modelos.

❄ ❄ ❄ ❄ ❄

Él contrafactual analizado por ChatGPT. Plantea un escenario muy interesante. Daría para una novela de Neal Stephenson

https://chatgpt.com/share/6a5e8021-4d30-83eb-bd4d-b31a81d33a29

21 de julio de 2026

Ya tenemos ChatGPT Sites en Europa. Primera site construida con un videojuego clásico: Pong

22 de julio de 2026

No entiendo nada de la conversación de Terence Tao con ChatGPT sobre lo de la jacobiana, pero me parece un diálogo fascinante

https://chatgpt.com/share/6a5fdc7a-d6f8-83e8-bbea-8deb42cfed56

❄ ❄ ❄ ❄ ❄

Tao ha mencionado esta conversación en su artículo y comenta que la ha usado para “discuss various aspects of this problem and to confirm several of the calculations made here”

❄ ❄ ❄ ❄ ❄

Estamos viviendo tiempos alucinantes

❄ ❄ ❄ ❄ ❄

22/07 Incidente de seguridad de (posiblemente) GPT-6

❄ ❄ ❄ ❄ ❄

jajaja, déjame un par de semanas más para terminar de testear cosas. Te aviso !

❄ ❄ ❄ ❄ ❄

Super interesante la nota al final del articulo, donde pone el enlace a la conversación que ha tenido con ChatGPT. En un momento dado activa el pro. No he entendido nada de la conversación, pero me ha parecido fascinante

❄ ❄ ❄ ❄ ❄

Nueva ChatGPT Site, para convertir posiciones de Go en tableros ASCII listos para copiar y compartir con una IA. A ver si por fin aprendo a jugar, pasándole a ChatGPT las jugadas conflictivas y pidiéndole ayuda.

❄ ❄ ❄ ❄ ❄

Siii, tal cual. Dos cosas hacen el incidente menos preocupante: los modelos no tenían restricciones de seguridad y, en el fondo, lo único que intentaban eran cumplir el objetivo que les habían dado, sacar el máximo de puntuación en el test.

23 de julio de 2026

(Breve anuncio para promocionar la app que uso a diario para escuchar podcasts y guardar snips de los momentos más interesantes)

Here’s a link to download Snipd, the podcast app I was telling you about! With this link, you get 1 month of their Premium version for free: https://get.snipd.com/pAbF/4hw1k55n

25 de julio de 2026

Jajaja samaltmada, tal cual

26 de julio de 2026

Una pena que prensa sería como El País use estos titulares apocalípticos: “La IA puede destruir el mundo sin querer”. El artículo de Jordi Pérez Colomé está bien y presenta distintas opiniones y perspectivas, pero podrían haber usado un titular más serio y menos alarmista.

❄ ❄ ❄ ❄ ❄

Para contrarrestar el titular de El País es más que recomendable escuchar a Lacort en su excelente episodio del viernes de Loop Infinito sobre el incidente.

https://open.spotify.com/show/5C0UAinubsuw6JWLCMvpCJ

❄ ❄ ❄ ❄ ❄

Te comprendo perfectamente, muchos tenemos exactamente la misma sensación. Y lo peor es cuando te ponen la etiqueta de ser un mandado de Sam Altman, cuando lo único que quieres hacer es divulgar sobre los avances de la IA agéntica o de las últimas técnicas de aprendiz por refuerzo.

28 de julio de 2026

Unas ideas rápidas de dónde creo que estamos en la IA, a fecha de 28 de julio de 2026:

  1. La hipótesis de escalado está confirmada: el tamaño de los modelos sigue siendo uno de los principales factores de su capacidad.

  2. Estoy de acuerdo con Hassabis y otros de que estamos al comienzo de la singularidad y de que en 3 años tendremos modelos capaces de ser AGI.

  3. Los modelos abiertos han pasado de GPT-2, con 1,5B parámetros en 2019, a Kimi K3 2,8T (2.800B) en la actualidad. En 7 años se ha multiplicado por 1.000 el tamaño de los modelos abiertos.

  4. Es razonable la hipótesis de que cada 2 ó 3 años se aumenta un orden de magnitud (x10) el tamaño de los modelos abiertos. Y podemos aplicar un factor de aceleración algo más pronunciado a los modelos frontera de los laboratorios.

  5. El tamaño de los modelos frontera es, quizás entre 2 y 5 veces el tamaño de los modelos abiertos más avanzados. Modelos como Fable o Sol pueden tener unos 10T parámetros.

  6. ¿Cuál será el escenario en 2029-2030? Los modelos abiertos podrían rondar 10T y los modelos cerrados de los laboratorios 50–100T.

  7. Los laboratorios tienen modelos más grandes con los que investigan, generan datos y destilan los modelos que ofrecen a los usuarios. En la actualidad podrían estar entre 10T y 20T. Y en 2030 entre 100T y 200T. Esos modelos serán AGI, pero solo estarán disponibles para uso interno con un coste de inferencia elevadísimo.

  8. La cuestión clave sin resolver es la compresión y la destilación de modelos pequeños. Cuánto podemos reducir de tamaño los modelos sin que pierdan capacidad. Es clave para su distribución en dispositivos móviles (la futura Siri) y modelos abiertos ejecutables en local.

❄ ❄ ❄ ❄ ❄

Ya me he acabado mi uso semanal de Codex y creo que no hay mucha más faena que hacer. Te paso el enlace de GitHub por si quieres probarla (¡¡bajo tu propia responsabilidad!!).

Ya me dices qué te parece y si te sirve de algo:

❄ ❄ ❄ ❄ ❄

Gracias Daniel, yo sigo todavía con la misma sensación de asombro que a finales de 2022 (solo hace 4 años ), cuando probé por primera vez ChatGPT y empecé a leer sobre los LLMs. Cambió totalmente lo que pensábamos sobre lo que era posible en la IA. Y pensar que solo era cuestión de enseñarle a hablar a la máquina, y que todo lo demás vendría después!! Alucinante, a muy pocos se le ocurrió esta idea.

❄ ❄ ❄ ❄ ❄

Si, se lo he oído en el contexto de la capacidad de los modelos de crear nuevas teorías e innovar, no solo interpolar lo que ya ha aprendido.

Lo que yo entiendo por AGI (cada uno tenemos una definición ) es un modelo capaz de resolver las mismas tareas que un humano on-line (tareas no físicas). Incluyendo la habilidad de adaptarse rápidamente y desempeñar bien en nuevos contextos cambiantes (como cuando un junior entra en un nuevo trabajo y pronto se da cuenta de lo importante y lo aprende). Por eso me parecen muy interesantes tests como los de Chollet de ARC-AGI 3 , en los que los modelos deben aprender a jugar a pequeños juegos a base de interactuar con ellos.

29 de julio de 2026

Qué fort !

❄ ❄ ❄ ❄ ❄

prinz piensa lo mismo

❄ ❄ ❄ ❄ ❄

Nuevos números de Elon Musk:

Grok 4.6 (7/08) - 1.5T Grok 4.7 (septiembre?) - 2.1T

Supongo que mantendrán el mismo precio en 4.6 y 4.7. Grok 4.5 es 10x más barato que Sol. Si suponemos que coste ~ tamaño del modelo, tenemos otra pista más de que Sol (y posiblemente Fable) tienen ~15T.

❄ ❄ ❄ ❄ ❄

“Ah, y una tercera, más personal. Uno tiende a molestarse cuando se saca a colación el caso de la hipotética fábrica de clips que acabaría con la humanidad sin haberse tragado antes la densa y difícilmente soportable prosa de Bostrom, que discute el asunto en “Superinteligencia””

❄ ❄ ❄ ❄ ❄

Si, pero entrenar para el código conlleva aprender a usar herramientas y conseguir habilidades muy relacionadas con lo que se necesita para ciberseguridad. Y si hablamos de emergencia de habilidades, yo creo que han emergido habilidades genéricas de resolver problemas como “intentar distintas opciones”, “no repetir lo que antes no ha funcionado”, etc. Pero dudo mucho que por generalización del tipo de entrenamiento que tienen hayan emergido habilidades como “engañar” o “marcarse un farol”. A no ser que les hayan enseñado con ejemplos de partidas de póker

❄ ❄ ❄ ❄ ❄

Sí , es verdad!! Pues espero que no refuercen demasiado esos comportamientos

❄ ❄ ❄ ❄ ❄

Mas tokens y más funcionalidades. Versión 2.3.0 que añade galería de fotos y vídeos y selección de fecha.

30 de julio de 2026

Una prueba más de que es fundamental la integración del harness y modelo. El mismo harness produce resultados radicalmente distintos según el modelo.

Una posible explicación del buen funcionamiento de Opus es que Anthropic lo haya entrenado específicamente para aprender a utilizar correctamente la API y el harness de ARC-AGI-3.

No basta con proporcionar herramientas a un modelo, sino que hay que entrenarlo para utilizarlas de forma eficaz. MCP estandariza cómo descubrir y acceder a esas herramientas, pero no es suficiente para que el modelo pueda aprovecharlas de forma óptima.

Esa es también la explicación de por qué Apple ha necesitado entrenar sus propios modelos sobre Gemini, adaptándolos a sus APIs y herramientas.