Nicolás Farchica Consultor IA

Nicolás Farchica Consultor IA Kontaktoplysninger, kart og anvisninger, kontaktformular, åbningstider, tjenester, stjerner, fotos, videoer og meddelelser fra Nicolás Farchica Consultor IA, Konsulentvirksomhed, Copenhagen.

Hoy Anthropic lanzó Claude Sonnet 5. Y la noticia real no es que salió un modelo nuevo.La noticia es lo que implica para...
30/06/2026

Hoy Anthropic lanzó Claude Sonnet 5. Y la noticia real no es que salió un modelo nuevo.

La noticia es lo que implica para cualquiera que construye sistemas con agentes: el modelo del "medio" ahora rinde cerca del modelo tope. Y cuesta entre 5 y 7 veces menos.

Eso no es una actualización. Es un cambio en el cálculo de cualquier arquitectura.

Los números que más me llamaron la atención:

→ Terminal-Bench 2.1: 80.4% (vs 67.0% de Sonnet 4.6 — +13.4 puntos)
→ Reasoning con herramientas: 57.4% (Opus 4.8 tiene 57.9%)
→ Knowledge work GDPval-AA: 1618 (Opus 4.8 tiene 1615 — Sonnet lo supera)
→ Computer use OSWorld: 81.2% vs 83.4% de Opus — diferencia de 2.2 puntos

Si usabas Opus para tasks agénticas, esta semana vale la pena repensar esa decisión.

El precio introductorio es $2/M tokens input y $10/M output — hasta el 31 de agosto. Después sube a $3/$15.

Escribí un análisis completo con la tabla de benchmarks oficial y qué deberías revisar en tu stack (link en los comentarios).

¿Ya lo estás probando?

La semana pasada fui al último meetup de Claude Code for Developers en Copenhague antes del verano, en las oficinas de S...
29/06/2026

La semana pasada fui al último meetup de Claude Code for Developers en Copenhague antes del verano, en las oficinas de SimCorp.

Más de 120 personas. Cinco charlas de gente que usa esto en producción — no demos.

▪️ Adil Karim de Oiya argumentó que un filesystem puede superar a RAG para búsqueda agéntica — y lo respaldó con un patrón open-source.

▪️ Alexander Junge y Jörn Petersen de Amass dejaron que Claude hiciera investigación solo durante la noche. Guardaron lo que mejoró. Revirtieron lo que no.

▪️ Marc Rasmussen de SimCorp mostró harness engineering en una migración de legacy real — los controles que mantienen un proyecto de 2.000 desarrolladores en carril.

▪️ Ivan Bozhkov de Merkle le dio a Claude tráfico de red real para atrapar los bugs que solo aparecen en runtime. Los que un modelo nunca ve en entrenamiento.

▪️ Andreas Elmertoft de Dwarf mostró cómo mantienen a Claude en contexto mientras se mueve por departamentos en un rollout a nivel empresa.

Diferentes stacks, diferentes problemas. Mismo hilo conductor: el modelo no es la parte difícil. La confianza, el contexto, y cómo esto encaja en una organización real — ahí está el trabajo de verdad.

Gracias a Jacob Langvad Nilsson por construir esta comunidad, a Anoop Sihag y SimCorp por el espacio y la comida, y a Anthropic por el apoyo. Nos vemos en agosto en Lundbeck.

El modelo más potente de Anthropic nació y murió en 96 horas. 🧵  El 9 de junio, Anthropic abrió Fable 5 al público — la ...
22/06/2026

El modelo más potente de Anthropic nació y murió en 96 horas. 🧵

El 9 de junio, Anthropic abrió Fable 5 al público — la versión accesible de Mythos, su modelo de clase máxima. Por primera vez, cualquiera podía usar un modelo de ese nivel.

Cuatro días después, ya no existía.

El Departamento de Comercio de EEUU ordenó bloquear el acceso a todo extranjero (export controls). El problema: no hay forma de distinguir en tiempo real quién es ciudadano de EEUU entre cientos
de millones de usuarios.

¿La solución de Anthropic? Apagarlo para todos. Global.

Hoy queda Opus 4.8 como fallback, y la promesa de restaurarlos "en cuanto se pueda".

Pero el precedente ya está: de lanzamiento a bloqueo global en cuatro días. Uno de los primeros casos así en la historia de la IA. Y no va a ser el último.

Te lo conté slide por slide acá arriba 👆

Dynamic Workflows llegó con Claude Opus 4.8 — y creo que es lo más importante del release.No son subagentes normales. La...
03/06/2026

Dynamic Workflows llegó con Claude Opus 4.8 — y creo que es lo más importante del release.

No son subagentes normales. La arquitectura es completamente distinta:

Con los subagentes normales, Claude guarda el plan en su propio contexto. A cierto punto, el contexto se satura, la coherencia baja, y el cuello de botella sos vos coordinando todo.

Con Dynamic Workflows, el plan vive en un script JavaScript externo. Claude lo ejecuta en background. Tu sesión queda libre. 16 agentes corren en paralelo, se verifican entre sí de forma adversarial, y vos recibís solo el resultado consolidado.

El caso real que más me impactó: Jarred Sumner (creador de Bun) migró 750.000 líneas de Zig a Rust en 11 días. 99,8% de tests pasando. Con ×2 agentes trabajando por archivo en paralelo. Lo que normalmente lleva meses con un equipo completo de ingenieros.

El breakdown completo está en el blog 👇

https://nicolasfarchica.com/blog/dynamic-workflows-claude-code-agentes-paralelo

Anthropic acaba de lanzar Claude Opus 4.8 — y armé un breakdown completo con los benchmarks reales.Lo más impactante: en...
01/06/2026

Anthropic acaba de lanzar Claude Opus 4.8 — y armé un breakdown completo con los benchmarks reales.

Lo más impactante: en USAMO 2026 (razonamiento matemático olímpico) pasó de 69.3% a 96.7%. Un salto de +27.4 puntos que no tiene precedente en esta línea de modelos.

También: 4× más detección de bugs vs Opus 4.7, 83.4% en computer use, y el único modelo en completar todos los escenarios de Super-Agent end-to-end.

Precio: mismo que Opus 4.7 ($5/$25M tokens). Sin waitlist. Ya disponible en Claude.ai, API, Bedrock, Google Cloud y Azure.

Y hay una novedad que me parece muy importante: Dynamic Workflows está en Research Preview — Claude Code orquestando 100+ agentes en paralelo para trabajar a escala de codebase real.

El breakdown completo (10 slides con todo) en el carrusel 👇

Project Glasswing + Claude Mythos: el modelo de IA que Anthropic decidió no publicar.Y después de leer los números, se e...
27/05/2026

Project Glasswing + Claude Mythos: el modelo de IA que Anthropic decidió no publicar.

Y después de leer los números, se entiende por qué.

En un mes, Claude Mythos encontró más de 10,000 vulnerabilidades de severidad alta o crítica. En software que usamos todos: sistemas operativos, navegadores, infraestructura crítica.

Algunos de los que más me impactaron:

→ CVE-2026-5194 en wolfSSL — permite falsificar certificados TLS para crear sitios bancarios fraudulentos. Mythos construyó el exploit completo.
→ Un bug de 27 años en OpenBSD, en producción desde 1997, nunca detectado por herramientas automáticas.
→ Un fallo en FFmpeg invisible para fuzzing en 5,000,000 intentos. Mythos lo encontró en su primer análisis.
→ Firefox: 181 exploits funcionales vs 2 de Opus 4.6. Mismo modelo, diferente nivel.

Pero lo que más me llama la atención no son los números. Es el problema nuevo que esto crea:

La IA ya descubre bugs más rápido de lo que los humanos pueden parchearlos.

99% de lo encontrado sigue sin parchar. Ese es el cuello de botella ahora.

Y en junio/julio, Mythos-1 llega a Claude Code.

Los detalles técnicos en el carrusel 👇

▎ 25 slash commands de Claude Code que vale la pena conocer. Guardalo como referencia — te va a ahorrar tiempo.▎ ¿Cuál f...
23/05/2026

▎ 25 slash commands de Claude Code que vale la pena conocer. Guardalo como referencia — te va a ahorrar tiempo.
▎ ¿Cuál faltaría en tu lista?

Karpathy eligió Anthropic.Uno de los investigadores más influyentes del mundo se suma al equipo detrás de Claude.No como...
21/05/2026

Karpathy eligió Anthropic.

Uno de los investigadores más influyentes del mundo se suma al equipo detrás de Claude.

No como asesor. No como inversor. Como researcher en el equipo de pre-training — la capa más profunda, la que define qué puede saber el modelo.

Y su tarea concreta: usar Claude para acelerar la investigación de Claude.

Sí, loop recursivo total.

Lo que más me llama la atención no es el hire en sí. Es que dejó su propia empresa (Eureka Labs) "pausada" para venir. Eso te dice todo sobre dónde él cree que va a pasar lo importante en los próximos años.

Si usás Claude — sea para código, agentes, MCPs o automatizaciones — esto te afecta directamente. Un mejor pre-training = mejor modelo base = todo lo de arriba mejora sin que hagas nada.

Los detalles en el carrusel 👇

20 turnos con Claude = 20 prompts tuyos. Le pedís que migre algo, trabaja, le decís "seguí", trabaja, "dale, terminá", t...
19/05/2026

20 turnos con Claude = 20 prompts tuyos. Le pedís que migre algo, trabaja, le decís "seguí", trabaja, "dale, terminá", trabaja. Vos sos el clock del loop.

Hasta que llegó /goal en Claude Code 2.1.139.

Le pasás UNA condición de éxito al principio. Claude itera turno tras turno hasta cumplirla. Sin que vos digas "seguí" entre vuelta y vuelta.

Por dentro funciona simple: un evaluator chico (Haiku) corre como Stop hook después de cada turno, lee la conversación, y decide si la condición se cumplió. Si dice no, arranca el siguiente turno automáticamente. Si dice sí, el loop termina.

La receta de una condición que funciona — 3 ingredientes:

▸ END STATE medible: "tests pasan", "lint en 0 warnings". No "que esté prolijo".
▸ STATED CHECK: cómo Claude prueba que llegó. Exit code > criterio semántico.
▸ CONSTRAINT: qué NO debe cambiar mientras itera. Sin esto, Claude puede deshabilitar tests para cerrar el goal.

Tip operacional: sumá "or stop after 20 turns" al final de la condición. Te salva de loops infinitos.

Sintaxis exacta, los 4 casos de uso oficiales, cómo funciona el evaluator interno y las limitaciones reales, todo acá:

👉 https://nicolasfarchica.com/blog/goal-claude-code-meta-autonoma

Adresse

Copenhagen
2900

Underretninger

Vær den første til at vide, og lad os sende dig en email, når Nicolás Farchica Consultor IA sender nyheder og tilbud. Din e-mail-adresse vil ikke blive brugt til andre formål, og du kan til enhver tid afmelde dig.

Genveje

Del