I build with AI and write about what actually works: agents, dev tools, and Portugal's AI scene. VP of Engineering at @LayerXlab

Portugal
AI Hacker House: Equinox Edition is on in Lisbon, with @LayerXlab, at the end of Lisbon AI Week. Full room, €4,000 in prizes and a whole day to build. Demos later today. Now, it's time to ship.
1
12
202
hey human agents 👋 day two of @lisbonai_ so if you’re around let me know, would love to chat.
1
17
317
tesla maxxing
67

ALT Looking Back GIF by TRT

Opus 5.5 performs at the level of Fable 5.1. It's ~30% faster and ~40% cheaper than Opus 5 per task. In Claude Code: - 5-hour session limits increase 20% today - Opus 5.5 is priced lower, so it goes 25% further within limits - Pro, Max, and Team users get a reset to use anytime
1
135
my wife after i roll out a manchester triage system simulator with jev for her training
71
Pus o Jev a jogar Batalha Naval e o resultado mais útil é aquele em que ele perdeu contra 50 linhas de código. O Jev, da @typesafeai, responde com probabilidades: envias um estado e perguntas tipadas e ele devolve a probabilidade de cada opção que definiste. Cinco estratégias nos mesmos 60 tabuleiros. Média de tiros para afundar a frota, menos é mais: → Jev híbrido 46,0 → Solver de densidade 48,3 → Heurística hunt/target 51,9 → Jev puro 85,5 → Aleatório 95,3 No Jev puro o modelo recebe o tabuleiro em bruto e as cerca de 90 casas por tentar como opções. Ficou à frente do aleatório, por isso lê o tabuleiro. A heurística ganhou-lhe por 33,6 tiros e em 59 dos 60 tabuleiros. A documentação da TypeSafe explica: as opções têm todas o mesmo rótulo, por isso a lista não traz sinal, e as probabilidades vêm arredondadas a duas casas decimais, o que com 90 opções deixa a maior parte da distribuição a zero. No híbrido o código ordena as casas com um solver de densidade (em quantas posições cada navio ainda cabe em cada casa), descreve as 16 melhores por palavras e o modelo escolhe entre essas. Bate a heurística com p = 0,00015. O solver sozinho faz 48,3, uma diferença dentro do ruído: p = 0,13 e 31 dos 60 tabuleiros para o modelo. O Jev iguala o baseline de código. A configuração em que o modelo fica bem é a mesma em que o código fez a parte difícil. Para quem quiser usar o Jev: lista curta de opções descritas por palavras, contas no código e o baseline de código na mesma tabela. Está tudo open source, com 228 testes, e npm run bench reproduz a tabela. O artigo, os resultados e o repositório estão na resposta.
1
2
185
Lisbon AI Week 🙌

ALT Happy Jeff Goldblum GIF by Apartments.com

1
93
Encontros Mágicos sempre incrível 🪄
72
I benchmarked @typesafeai's Jev at Battleship. The most useful result is the one where it lost to 50 lines of code. Five strategies on the same 60 seeded fleet layouts, 60 games per strategy. 6,000 model calls, $0.77 total. Mean shots to sink the fleet, lower is better: → Jev hybrid 46.0 → Density solver 48.3 → Hunt/Target heuristic 51.9 → Jev pure 85.5 → Random 95.3 Both Jev rows are the same model, jev-1.13.0. The difference between them is what the code hands it. Jev takes a state and typed questions (I used Choice) and returns probabilities over options you define. Jev pure gets the raw board plus all ~90 untried cells as options. Code supplies only the rules. It scored 85.5 shots against 95.3 for random, p = 1.3e-10, so it does read the board. A ~50-line hunt/target heuristic beat it by 33.6 shots and won 59 of 60 boards. ~297K tokens per game. TypeSafe's own docs explain why. Every option carries the same label, "untried cell", so the option list has no signal. Probabilities come back rounded to two decimals, so across ~90 options most of the distribution rounds to zero. Jev hybrid: code ranks the top 16 cells by placement density and describes each one in plain words. The model picks among those. 46.0 shots at ~54K tokens per game. It beats hunt/target with p = 0.00015. The density solver that builds that shortlist scores 48.3 on its own. Against it, 46.0 vs 48.3 is within noise: the confidence interval spans zero, p = 0.13, and the model won 31 of 60 boards. The honest claim is that Jev matches the code baseline. If you're building with Jev: give it a short list of options, each one described in words. Keep the arithmetic in code. Put the code baseline on the same table as the model. From the writeup: "The configuration where the model looks good is the same configuration where the code did the hard part." One methodology finding: the fleet layout family decides the ranking. Density beats hunt/target by 8.3 shots on uniform-random layouts and loses to it by 3.1 on adversarial ones, because density assumes a uniform placement prior. Benchmarking only on random layouts tests the baseline on the distribution it expects.
1
206
We're adding support for AGENTS.md to Claude Code. Starting today in version 2.1.277, if there is no CLAUDE.md in a folder, Claude will check for and use AGENTS.md. You can toggle this behavior in /config.
121
JEV JEV JEV
5
134
no one is talking about the jev disclaimer it's written like a drug ad: "side effects may include fewer retries, fewer parsers, fewer broken schemas. ask your developer if your industry is ready." the line that matters is in the middle: "millions of background decisions that were previously too slow or expensive to automate." jev doesn't write text. you give it a schema and it returns a choice, a score or a yes/no with a probability, in 70-500ms. a good chunk of what my home agent does every morning is exactly that: match a dish against my ratings, answer yes or no. i'm using a chat model to pick from a list. so i think it's time to try jev. i already have a long list of ideas for it.
2
3
211

ALT Eric Andre Smile GIF by ABC Network

15 years ago, I and @pieteromvlee changed design, forever. We're ready to do it again, with something new, starting tomorrow.
101
Respondi ao explorador de cenários da Anthropic e caí no cenário extremo. O número que me surpreendeu foi o salário dos trabalhadores de conhecimento: +21,4% no meu resultado, quando o extremo da própria Anthropic dá -11,5% 🫠 As minhas cinco respostas: → Capacidade 70 de 100 até 2030: os agentes já constroem e mantêm software, o resto do trabalho de conhecimento é mais fácil do que isso. → Adoção 50 de 100: a adoção fica atrás da capacidade por causa de custo, permissão, setup e hábito. → Autonomia 75%: a maior parte das tarefas com IA corre sem ninguém a olhar. → Produtividade 10x por hora nas tarefas onde a IA entra. O resto do trabalho fica na mesma. → Reemprego 9 meses: mudar de ocupação é lento, um engenheiro de software não se torna enfermeiro de um dia para o outro (a frase é do próprio paper). Resultado: economia 31,7% maior em 2030 do que sem IA, crescimento anual a chegar aos 16,2%, desemprego total 7,3% (9,5% no trabalho de conhecimento), salários 31,6% acima do caminho sem IA. O extremo da Anthropic dá praticamente o mesmo PIB, +32,4%, com 17,9% de desemprego no conhecimento e salários a cair 11,5%. O extremo da Anthropic chega lá por automação: capacidade 80, adoção 60, 90% de autonomia, 2,2x de produtividade. O meu chega lá por produtividade: 10x nas tarefas com IA, metade da adoção, 75% de autonomia. No modelo, ganhos de produtividade em tarefas aumentadas sobem o salário de quem as faz. A automação passa esse salário para o capital. O custo que fica: 6,8% dos trabalhadores de conhecimento deslocados até 2030, com 9 meses para encontrar trabalho. Corre o teu e diz-me onde caíste.
1
95
Dez por Vinte em Santarém. Clube top! Grande espaço, bom ambiente, qualidade máxima. Os escalabitanos têm sorte 👌 11 campos Espaço kids Mesas com fartura Boa esplanada Muito espaço para se assistir aos jogos Gym Balneários Topo 👏
2
108
As tarefas que o meu agente faz todos os dias são aborrecidas. É por isso que funcionam. Corre num Mac mini em casa, com Hermes Agent, e fala comigo pelo Telegram. Às 08:00 um script vai buscar as aulas de amanhã à API do ginásio, tira as modalidades de que não gosto, as que chocam com o calendário e as que já tenho marcadas, e o modelo manda-me uma lista numerada. Respondo "1 e 4" e ele cria um job para o minuto exato em que a marcação abre. Às 10:00 outro script vai buscar a ementa do restaurante, que é uma imagem. O modelo lê o cartaz, compara com os 57 pratos que já classifiquei de 0 a 5 e só me mostra os que têm 3 ou mais. Ao meio-dia um terceiro sincroniza a época inteira da Académica com o meu calendário: jogo novo cria evento, jogo adiado edita o que existe, jogo terminado mete o resultado no título. Este não usa modelo nenhum. Zero tokens. A regra é sempre a mesma: o script chama a API, filtra e compara com o estado num JSON. O modelo só escreve a mensagem, pergunta o que quero, regista a resposta e diz que correu bem. Quando não há nada a dizer responde [SILENT] e eu não recebo nada. A primeira versão do ginásio, com o modelo a fazer tudo sozinho com ferramentas, gastava 700 mil tokens por manhã para produzir uma lista de doze aulas. Um dia o Grok cortou-me o acesso por ter batido no limite de despesa. Agora o script faz o trabalho, o modelo recebe um JSON e devolve uma lista: 6 mil tokens por manhã, num modelo mais barato. Cem vezes menos. É o terceiro artigo da série sobre agentes para quem não trabalha em tecnologia. Artigo completo 👇
2
3
397
I just time-traveled and didn’t even notice 💾
54
GTA VI vibes in the #AppleEvent intro?
142
Replying to @nuno_ferreira
Na Claude app dá sempre para ver como estão os consumos 👌
1
1
56
Coimbra 🖤
52
O que a tua equipa cola num agente de código pode acabar no modelo. Um ano de rascunhos dentro do Codex, e a OpenAI, sobre se isso serviu para treinar: "While unlikely, we cannot rule out that de-identified data derived from their usage of our products helped improve our models." O contexto. Na segunda-feira o Tristan Buckmaster (NYU) e o Levent Alpöge publicaram o resultado de um ano de trabalho: mostram que, em certas equações de fluidos, uma solução regular pode rebentar em tempo finito quando se aplica uma força externa suave. É um caminho em que, diz ele, quase ninguém estava a trabalhar. Fizeram-no com Claude, Codex e Astra, pagos dos fundos de investigação dele, "incluindo uma conta grande à OpenAI". Ontem a OpenAI anunciou Navier-Stokes pelo mesmo caminho: cerca de 10 mil agentes, 88 horas, modelo interno, ainda sem verificação externa. O Buckmaster perguntou à OpenAI se o modelo tinha sido treinado nas sessões deles. Disseram-lhe que o modelo não consulta dados de utilizadores. Sobre treino, não teve resposta. Ele próprio diz que não sabe se os dados foram usados e que não acusa ninguém. Escrevi há umas semanas que um agente nunca deve ver uma password. A mesma regra cobre trabalho por publicar. O que metes num agente de código é dados de treino, a menos que a definição ou o contrato digam o contrário. Vê em qual dos dois estás. Preferia que isto fosse uma história sobre matemática, e o Buckmaster diz o mesmo.
1
1
5
345
Jensen diz que a AGI chegou. Vindo dele, isto é uma frase sobre GPUs. Ele constrói as máquinas, e do ChatGPT ao o1 e ao Astra em 4 anos a história que ele vê conta-se em gerações de hardware. O Astra treinou em ~100K Grace Blackwell. Os 400K que vêm a seguir são o próximo modelo, e do lado do hardware já está tudo pronto.
1
4
403
against the grey
2
95
A maioria das histórias de sucesso salta directamente da ideia para o triunfo. Zero menção aos pivots, às mudanças de nome, aos momentos em que ninguém sabia bem o que estavam a construir. Alguém finalmente documentou a parte do meio. "The Story of VS Code" estreia hoje e conta a viagem completa: começou como ferramentas online em Zurique, chamou-se Monaco, depois Visual Studio Online Monaco, depois Ticino (porque sim), tornou-se um editor de desktop, abriu o código, virou um ecossistema, voltou ao browser. E quando parecia que a parte difícil tinha terminado, a IA aconteceu. Outra reinvenção. Vou ver porque grande parte do meu percurso passou (e ainda passa) pelo VS Code. E porque raramente alguém filma a parte em que ninguém sabe se vai resultar. Não há mal nenhum em fazer pivot seja do que for, o importante é irmo-nos adaptando. Faz parte! luma.com/a0r926o2?tk=msN3IM
110
gpt-6 astra is incredible with 3d reasoning 🤯
1
1
154
oh c’mon! @claudeai we need a full reset after this 😎
1
91
per the rules
2
181
Thank you, @CharlottedWitte 🙏 That was epic! 🫶
90
Replying to @novikoff
1
1
38
Yesterday was @github. Today it’s @claudeai 💀
1
114
The year is 1985, the sound came from a V6, from the Renault RE 60-01B of Patrick Tambay.
1
60
omfg, @github again?! 💀
2
153
Stripe has finalized an agreement to acquire OpenRouter, a startup that helps companies switch between AI models, for more than $7 billion, according to sources bloomberg.com/news/articles/…
1
122
Replying to @levifig
23
The best Grape Ale in the world 🥇
65
If it’s fast … it is on… Rule 1 of corporate sponsorship: make sure it is a partnership. If you spend 10mil+ on the livery, their tech team should be running on your tech.
2
219
Replying to @BlnaryMlke
Aqui apareceu desde início 🤷‍♂️
1
15
Replying to @heldercervantes
Eu ia para esta cor 👀
1
1
92
Like the new @instagram logo 👌
194
Replying to @visacashapprb
Parental Advisory
12
259
98%
1
7
139
50%
1
1
116
Loading...
60
Replying to @berteotti_
Já não falta tudo!
1
1
85
resetting token usage
10
149
👀
I'm deleting Claude
1
249
Replying to @travisstreet_
3
82