Experimento con Machine Learning, NLP y LLMs. 🇦🇷 en 🇲🇽 Construyendo @ ElectorIA Además, me gusta mucho hacer reír

Argentina
Comparto en este hilo algunas ideas que tensionan el optimismo del desarrollo con agentes. Puedo cambiar de opinión con el tiempo.
1
2
809
Primeras pruebas con la api de decisiones de OpenAI, un poco decepcionado. - Me rechaza varios ejemplos sin explicar por qué (unicamente dice refused), voy a intentar inferir - Se rompe por 503 muy seguido.
1
43
Si le dan a un modelo de decisión algo que se puede resolver con una regex, está claro que en el benchmark de velocidad va a ganar la regex. Hay deshonestidad ahí, es como si yo dijera que chatGPT no sirve para nada porque tarda más que un if en decidir si un número es par.
3
9
303
Lo que me molesta de estos es que siempre proponiendo falsas dicotomías. Es irrespetuoso con Messi querer usarlo de excusa para sacar una imagen de Evita.
PROYECTO DE LEY. Mañana, como ciudadano y a través de una iniciativa popular, voy a presentar un proyecto de ley para reemplazar la imagen de Eva Perón del edificio de Desarrollo Humano por una de Lionel Messi.
36
Muchos vibes de cumpleaños de 15 en el polideportivo del pueblo
1
1
79
El único LLM wrapper por el que vale la pena pagar es Lucas Biagetti
3
129
El dominio '.ai' es de vendehumo. El '.si' seguro se está por poner de moda y también lo es.
1
5
275
Respecto a figuras, Milei y @CFKArgentina concentraron el 71% de la atención. Sorpresivamente @Kicillofok es el que mejor balance red/green flag tiene.
¿De qué hablan los medios en Argentina? Del 29/9 al 4/10 en el prime time de LN+ - 83 menciones a instituciones. - 25 a economía. - 2 a seguridad. - 1 a educación. - 0 a salud pública. Construí electoria.com.ar para ver dónde ponen el foco los medios.
1
1
58
También es importante que otras personalidades como @myriambregman @VickyVillarruel o @morenoparalavic no fueron mencionados ni una vez.
1
27
¿De qué hablan los medios en Argentina? Del 29/9 al 4/10 en el prime time de LN+ - 83 menciones a instituciones. - 25 a economía. - 2 a seguridad. - 1 a educación. - 0 a salud pública. Construí electoria.com.ar para ver dónde ponen el foco los medios.
1
3
6
271
Dato curioso: el martes la conversación estuvo atravesada más que nada por política e instituciones, mientras que el viernes por economía.
2
27
En Electoria tuve la bendita suerte de que el primer merge que hice sin probarlo en staging rompía la mitad de los endpoints.
53
Harto de que confundan la herramienta con la tecnología.
1
7
343
Todas las muertes de músicos traen consigo el recordatorio de que algún día Charly García va a partir
1
91
Tengo que comprender, no es eterna la vida El llanto en la risa, allí termina
3
61
Para qué pagar una subscripción de 20U$D si lo puedo hacer con una cuenta de Claude de 100, lleno de errores y gastando 50 en Cloud?
4
175
Actualicé mi benchmark de text clasification (rebrandeados decisión model) para incluir cosas que aparecieron recientemente, como JEV y saldar algunos baches. JEV gana en clasificación zero-shot (en mi análisis exploratorio) Cuando Openai abra su decisión API veremos qué pasa! github.com/lucasbiagettia/ll…
1
46
No sé si tengo el ojo cada vez más afinado o si el texto LLM-generado es cada vez más evidente.
1
1
59
Está creciendo un enfoque que divide razonamiento de decisión, y más o menos postula que los LLM que conocemos son buenos para razonar, pero que vale la pena añadir una capa de decisión atrás gobernada por otra lógica (acá entran tecnologías como JEV) Yo le veo mucho futuro, las investigaciones son inminentes y los resultados aún son modestos (reales pero modestos), además de la dificultad de implementación. Es por eso que pienso que quizás clasificación de texto y modelo de decisión sí tengan naturalezas distintas y no sólo son marketing.
1
2
90
Un amigo me contó que una vez entrenó un modelo de clasificación de imágenes con su propio dataset. El mismo sacó las fotos de lo que tenía que clasificar, en este caso eran distintos tipos de vegetales que la máquina cosechadora tenía que clasificar. Como todos sabemos, dividió el dataset en train, val y test. Resultados buenos, ajustaba rápido, buenos resultados con el dataset de test. Cuando lo pusieron en producción, el modelo de prueba (CON SOLO DOS VEGETALES) fue un terrible desastre, una precisión del 50%. ¿A alguien se le ocurre por qué?
1
5
227
Resulta que las fotos de un vegetal las había sacado de mañana temprano, las otras al mediodía. El modelo había aprendido a identificar qué hora del día era. Los datos no son una pavada, creo que este ejemplo explica por qué tantos modelos miden tan bien en benchmarks y en la vida real dejan mucho que desear.
2
29