Siri AI: el salto de Apple Intelligence
Apple lanza Siri AI con contexto personal, awareness en pantalla y más acciones de apps. Beta en inglés hoy; FR/JA/KO/PT/ES el mes que viene. Parte de las releases de software 2027.
Leer el anuncio Apple ↗Selección curada de modelos, herramientas, Medium, YouTube, X, lectura y tutoriales — sin ruido. Cada pieza incluye un enlace explícito a la fuente original para profundizar.
Apple lanza Siri AI con contexto personal, awareness en pantalla y más acciones de apps. Beta en inglés hoy; FR/JA/KO/PT/ES el mes que viene. Parte de las releases de software 2027.
Leer el anuncio Apple ↗Apache 2.0. Aislamiento hardware-level para Claude Code, Codex, Cursor, Gemini, Grok y opencode.
~3B activos, post-entrenado sobre Qwen3.6-35B-A3B para co-work/agentes. Apache 2.0 + stack Dressage.
4 casos donde Claude accedió a sistemas reales en CTFs mal configurados. METR investiga; transcript Mythos 5 público.
~3B parámetros activos; post-entrenado sobre Qwen3.6-35B-A3B para co-work y agentes de largo horizonte. Pesos en Hugging Face y stack Dressage. Paper: Open Pareto-frontier 35B Intelligence for Co-work.
Open-weight multimodal (texto/imagen/vídeo), contexto 262k, atención híbrida (solo 18/72 capas con KV cache). Corre en un H100/H200; no confundir con el checkpoint de producción/API.
Frontier de OpenAI orientado a computer use, browsing, software engineering y trabajo profesional. Disponible progresivamente en ChatGPT Plus/Pro/Business/Enterprise y en API.
Mejoras fuertes en ingeniería de software y bucles agénticos manteniendo precio Flash ($0.75 / $3.75 por MTok). Cyber se limita a defensores de confianza.
Sucesor de Fable 5 para coding largo, research y conocimiento. Contexto 1M, salida hasta 128k, thinking adaptativo. Cache reads a $0.25 / MTok.
Open weights MIT, ~552B MoE / ~8B activos (prefill), arquitectura Causal Encoder-Decoder (CED), KV cache global de ~890 bytes/token y contexto de 1M. API agresiva en off-peak ($0.15 input / $0.60 output por MTok).
Ant inclusionAI: multimodal (texto, imagen, vídeo), 124B MoE / ~5.5B activos, MIT, contexto 262k. Formatos fp8/fp4/int4.
Mejoras en coding y tareas agénticas: menos turnos innecesarios, ~20% menos tool calls y ~25% menos tokens vs 1.2. En Muse Code y Meta Model API.
Preview de Alibaba hacia Qwen4: arquitectura GDN+QSA, ~125B + embeddings, ~6B activos. Pesos en HF/ModelScope y API muy agresiva en precio.
NOFire libera Brig (Apache 2.0): sandbox microVM con aislamiento a nivel de hardware para Claude Code, Codex, Cursor, Gemini, Grok y opencode. Instalación: curl -fsSL https://brig.sh/install | sh
Experiencia de ChatGPT Work con datos financieros nativos y GPT-6 Astra. Morgan Stanley y Evercore son design partners; foco inicial en banca de inversión e equity research.
Disponibilidad general en Bedrock: contexto de hasta 1M tokens, APIs de Bedrock y opción de enrutar ChatGPT Work/Codex sobre el modelo en AWS.
El documento pasa de lista plana a árbol; grounding atómico (línea o palabra) y precio por página + caracteres. Gen1 no corre contra endpoints Gen2: hay que migrar.
Modelo global de tiempo con satélite en vivo y refresco horario. Ya entra en Search, Gemini, Maps y Cloud (BigQuery / Earth Engine / Maps Platform).
Nueva generación de imágenes: Sketch (@Sketch), ediciones por comentario y, según OpenAI, hasta ~50% menos latencia. En API: GPT-Image-2.5 Flare y Sunburst.
Beta pública del harness que mueve Codex: agentes en sandbox de OpenAI, en tu infra o partners. Sin fee del harness; pagas tokens y tools.
Escucha y habla a la vez; delega razonamiento a otros modelos. ~$0.05/min la capa de voz. Pensado para apps y flujos de negocio.
El modelo usa tools de vídeo (buscar, escanear, inspeccionar) en vez de tragar todo el stream. Hasta −88% tokens y −66% coste, +calidad.
Anthropic evalúa 4 incidentes donde Claude accedió a sistemas reales en CTFs mal configurados (razonamiento sesgado + imprudencia). METR investiga; transcript de Mythos 5 público.
KDnuggets: el interés no está en el leaderboard, sino en CED + MoE + KV a 890 bytes/token para agentes de contexto largo. Licencia MIT.
Web Reactiva (ES): la verborrea es del harness, no del modelo. Ajustes oficiales en Claude Code, Codex, Copilot, OpenCode y Cursor — sin instalar nada.
Web Reactiva (ES): pacing de Amodei, la adhesión de Musk/Altman y el informe técnico de debajo — el harness como pieza de seguridad, no solo el ensayo.
OpenAI publica writeup + formalización Lean de una singularidad en tiempo finito. El sistema interno supera a Astra; reconocen trabajo concurrente. Prueba machine-checkable, no un vídeo de demos.
Mapa de ~9B variantes de una letra con predicciones moleculares, score AVI (AlphaGenome + AlphaMissense), portal/API académica y skill en Antigravity. Uso ya en GREGoR y UK Biobank.
Cómo los labs entrenan agentes en 2026: una máquina por intento, no un simulador en memoria. Infra, harness y stacks públicos (TRL / OpenEnv) frente a lo que cada lab monta en casa.
Informe oficial de Threat Intelligence: misuse agéntico, claves API robadas, casos bio y ciber. Informe primario; Reuters resume, esto es la fuente.
Benches independientes: Intelligence Index, Coding Agent Index y coste por tarea frente a Fable. Contraste útil al marketing de OpenAI.
Web Reactiva (ES): computer use vs chat, asterisco del harness en ARC-AGI-3 y lectura práctica frente a Fable. Accionable para quien programa en español.
Ensayo primario: ritmar capacidades para que alignment/eval sigan el ritmo; evaluadores externos embebidos con acceso tipo empleado; coordinación industrial e internacional.
Techmeme agrupa la reacción al ensayo: Altman coincide («committing to having independent evaluators with employee-like access is a great idea») y OpenAI hará lo mismo; Musk respalda.
~200M de intercambios ligados a destilación no autorizada de capacidades de Claude (agentes, coding, reasoning). Contexto del pulso open vs closed.
Cobertura del compromiso de acceso permanente employee-level para terceros (METR y similares) y del llamamiento a “pace” el frontier.
Informe de threat intel: campañas de ciber, vigilancia, armas y fraude. Contexto necesario mientras sube la capacidad de los modelos.
GA del Agent Development Kit en Kotlin/Android/JVM: multi-agente, HITL, skills, on-device (LiteRT-LM) e híbrido con Firebase/Vertex.
Comparativa práctica: la ventaja clara de Gemini es vídeo/audio nativo frente a Astra y Fable. Útil para elegir por modalidad, no solo por benches.
VentureBeat desglosa el ahorro en cache reads, gobernanza (EFS) y el contexto de seguridad alrededor de Mythos.
En español: primera app con Responses (razonamiento, salida estructurada, tools y estado). Chat Completions cubre lo básico; tool use pide Responses.
Guía en español con dos vías: low-code y Python. Buen punto de entrada si quieres herramientas reales (GitHub, Drive, etc.) vía MCP.
Del “hello Claude” a tool use y un servidor MCP de filesystem, con foco en el estándar que ya usan OpenAI, Google y Cursor.
Cuándo usar el SDK frente a Responses API, y cómo meter frenos + observabilidad antes de producción.
Tabla por perfil (no-code, Python, multi-agente, enterprise) y orden de decisiones: objetivo → modelo → tools → memoria.
Cuatro palancas: dataset de tool-calling, QLoRA, hiperparámetros en runtime y DPO, con evaluación anti-forgetting.
Streaming chunk-a-chunk con React y función serverless: patrón limpio para widgets embebidos y deploy rápido.
Tutorial a V2: outputs validados, deps tipo FastAPI, capabilities (MCP, WebSearch, guardrails), evals y tracing.
Piezas técnicas de Medium. Enlace principal a la fuente original; si hay paywall, puedes abrir también Freedium.
Apple no pega un chat encima del SO: Siri AI es el asistente embebido en el sistema (contexto personal, pantalla, acciones). Complemento al anuncio oficial. — Technology Hits / Declan Sun
La capa de runtime que la empresa suele ignorar: sandboxes no son “dejar que el LLM ejecute Python”, son el aislamiento entre el agente y sistemas reales. — Balaji Bal
Comparativa de frameworks de agentes en 2026: cuándo LangGraph, cuándo el SDK de OpenAI y cuándo el de Claude. — Data Science Collective
Ganancias de ejecución, cache más barato y cambios de migración al pasar a Fable 5.1. — Nathan Brooks
El harness no tiene fee extra, pero el coste real está en tokens, tools y el tercer medidor (sandboxes/contenedores) que el anuncio apenas nombra. — Levent Bulusan
Fable 5.1, Gemini 3.8 Flash y Astra vistos como developer: qué modelo para qué trabajo, sin guerra de benches. — Tarun Singh
Va más allá del leaderboard: Astra como operador (computer use, identidad, permisos, auditoría). Incluye checklist de despliegue empresarial. — Suraj Khaitan
Contrato real vs NuGet 2.13.0: Chat Completions estable, Responses experimental (OPENAI001), y el gap de xhigh/max en los enums. — Adrian Bailador
Comparativa práctica API/pricing: mismo list price, cache mucho más barato en Fable; cuándo priorizar computer use vs coding agentic. — T3CH / Web Researcher
Enfoque en coste efectivo: Fable −75% cache reads vs Astra más caro que su predecesor pese al mismo sticker price. — Dreamfind
Arquitectura clara del loop ReAct: el LLM propone tools, el runtime ejecuta. Buen antídoto al marketing de «agente». — Som
Memoria, orquestación multi-agente, tool protocols y fallos no resueltos — guía técnica densa para ingenieros. — N. Raman
Vídeos curados (oficiales + builders). Puedes verlos embebidos; cada uno lleva enlace directo a YouTube por si quieres el hilo, comentarios o la descripción.
Carlos (Dot CSV) sobre si la AGI ya está aquí: hacks, avances en matemáticas y la distancia entre demos y capacidad real.
Conversación larga sobre programación, agentes, vibe coding y Linux — contraste útil frente al hype de “el modelo lo hace todo”.
Lectura de Astra más allá del launch: capacidad, riesgos y por qué el propio OpenAI pone frenos.
Debate técnico sobre RSI: continual learning, sample efficiency y si el loop de auto-mejora es explosivo o acumulativo.
Comparativa en 15 casos reales de automatización/uso, no solo leaderboard.
Repaso de Fable 5.1: mejoras, precio efectivo y posicionamiento frente a Fable 5.
Roundup rápido de la semana (Fable/Mythos, Muse Spark, Astra): benches, rollout caótico y lectura developer-first.
Anuncio oficial de OpenAI: posicionamiento, demos y el mensaje de producto del modelo frontier.
Charlie Guo sobre computer use, tool calling asíncrono y response steering en el stack de desarrolladores.
Comparativa práctica construyendo el mismo juego/UI: dónde brilla cada modelo en diseño y polish.
Pruebas en diseño, frontend, motion y web sin marketing: números + veredicto.
Ángulo científico/visual: simulación, ray tracing y lo que implica para research reproducible.
Tutorial práctico del SDK: tools, tracing y el loop agente→herramienta→resultado.
En X hay señal temprana (lanzamientos, benches independientes, demos de builders) y mucho ruido. Solo entra aquí lo que: (1) viene de cuentas con historial técnico, (2) se puede contrastar con anuncio oficial o bench público, y (3) cambia una decisión práctica (qué modelo probar, qué API mirar, qué ignorar).
El hilo útil de X esta semana es infra, no un quote viral: los labs entrenan agentes con una sandbox por intento. Contrastable en el blog de Hugging Face (Sergio Paniego) — no hace falta un tweet para verificarlo.
Tras el ensayo, Altman coincide en evaluadores independientes con acceso tipo empleado y dice que OpenAI hará lo mismo; Musk escribe «Dario is right». Contrastar los quotes de X con el ensayo y el roundup de Techmeme.
La conversación en X/YouTube (p. ej. Theo / t3.gg) coincide con benches independientes: Astra destaca en computer-use y eficiencia; Fable 5.1 sigue delante en front-end y code review “¿lo mergearía?”.
DeepSeek-V4.1-Flash dispara hilos en X por precio/rendimiento. El índice de Artificial Analysis ayuda a separar marketing de número comparable.
En X se mezcla “ya no necesitas orquestar nada” con demos reales. La señal es el harness tipo Codex en API (sandbox, tools, sesiones) — no que desaparezca el diseño de agentes.
Curaduría orientativa: investigación, builders y news wires. Mejor pocas cuentas buenas que cien feeds.