Aller au contenu principal
Retour au blog

Claude 3.5 Haiku et Computer Use : l'IA qui pilote votre écran

Flavien Métivier22 octobre 20246 min

Le 22 octobre 2024, Anthropic ne publie pas juste une mise à jour de modèle. L'entreprise sort simultanément trois choses : un Claude 3.5 Sonnet retravaillé avec un bond de performance mesurable, un nouveau modèle économique — Claude 3.5 Haiku —, et surtout la bêta publique de Computer Use, première capacité d'un modèle frontier à voir un écran, déplacer le curseur, cliquer et taper du texte. Ce n'est pas une démo de laboratoire : c'est disponible via l'API dès aujourd'hui, pour n'importe quel compte Anthropic.

Trois sorties, une journée — ce qui change vraiment

L'annonce officielle regroupe trois sorties distinctes. Claude 3.5 Sonnet est mis à jour — identifié claude-3-5-sonnet-20241022 — avec un résultat de 49 % sur SWE-bench Verified contre 33,4 % en juin. SWE-bench Verified mesure la résolution autonome de vrais bugs GitHub : quinze points de progression en moins de cinq mois, au même prix, sous le même nom de famille. Claude 3.5 Haiku arrive comme successeur du Claude 3 Haiku : plus rapide, plus intelligent, toujours positionné sur le segment économique. Et Computer Use passe en bêta publique — accessible immédiatement via l'API.

  • Claude 3.5 Sonnet v2 (claude-3-5-sonnet-20241022) : SWE-bench Verified 49 %, même tarif API que la version de juin 2024
  • Claude 3.5 Haiku : modèle rapide et économique de nouvelle génération — performances annoncées supérieures à Claude 3 Opus sur plusieurs tâches de code et d'analyse
  • Computer Use (bêta publique) : le modèle voit un screenshot, décide d'une action (clic, frappe, déplacement), tu l'exécutes côté serveur et tu renvoies le prochain screenshot

Computer Use en pratique : la boucle screenshot-action

Le principe est simple à comprendre, mais le diable est dans les détails. Tu envoies un screenshot encodé en base64, le modèle répond avec une action structurée (left_click, type, screenshot, key…), tu l'exécutes sur une VM, tu renvoies le nouvel état de l'écran. C'est une boucle synchrone. Anthropic fournit une image Docker de référence avec Xvfb, VNC et Firefox pour bootstrapper un environnement isolé en quelques minutes. Voici le point d'entrée API :

import anthropic
import base64
from pathlib import Path

client = anthropic.Anthropic()

# Screenshot initial de ton environnement (Xvfb + scrot, par exemple)
screenshot_b64 = base64.standard_b64encode(
    Path("screenshot.png").read_bytes()
).decode("utf-8")

response = client.beta.messages.create(
    model="claude-3-5-sonnet-20241022",
    max_tokens=4096,
    tools=[
        {
            "type": "computer_20241022",
            "name": "computer",
            "display_width_px": 1280,
            "display_height_px": 800,
            "display_number": 1,
        }
    ],
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "image",
                    "source": {"type": "base64", "media_type": "image/png", "data": screenshot_b64},
                },
                {
                    "type": "text",
                    "text": "Navigue sur http://localhost:8000/admin, connecte-toi avec admin/admin "
                            "et prends une capture d'écran de la liste des utilisateurs.",
                },
            ],
        }
    ],
    betas=["computer-use-2024-10-22"],
)

# Chaque bloc tool_use contient l'action à exécuter
for block in response.content:
    if block.type == "tool_use":
        action = block.input  # ex: {"action": "left_click", "coordinate": [640, 400]}
        print(f"Action : {action['action']} — coordonnées : {action.get('coordinate')}")

Dans une vraie implémentation, tu interceptes chaque bloc tool_use, exécutes l'action via xdotool ou en pilotant Firefox en mode headed, captures le nouveau screenshot avec scrot ou gnome-screenshot, et le renvoies comme tool_result. L'environnement Docker de référence d'Anthropic est open source — c'est le point de départ le plus solide pour ne pas se battre avec la config X11.

Les limites concrètes — la bêta, c'est une bêta

Votre équipe utilise Claude Code ?

Découvrir le workshop

Anthropic est transparent dans son annonce : Computer Use est expérimental et ne doit pas toucher des systèmes critiques en production. Les points de friction mesurés en pratique sont bien réels.

  • Latence : chaque tour de boucle (screenshot → inférence → action) prend plusieurs secondes. Pour du scripting interactif rapide, c'est trop lent — pense flux de smoke test, pas remplacement d'un clic humain.
  • Fiabilité visuelle : le modèle peut rater sa cible de quelques pixels, surtout sur des interfaces denses. La résolution 1280×800 recommandée dans les docs tient mieux.
  • Coût token : un screenshot encodé en base64 pèse lourd. Sur des échanges longs avec beaucoup d'allers-retours, la note API monte vite.
  • Sécurité : l'injection de prompt via le contenu visible de l'écran est un vecteur d'attaque documenté. Ne donne pas accès à un environnement contenant des données sensibles.
  • Cas non couverts nativement : CAPTCHA, fenêtres modales OS natives, éléments hors viewport sans scroll explicite.

Les cas d'usage raisonnables aujourd'hui : smoke tests visuels sur des interfaces internes, scripting de tâches répétitives sur des outils legacy sans API, démos automatisées d'onboarding. Ce n'est pas un remplacement de ta suite Cypress ou Playwright pour les tests de régression en CI.

Claude 3.5 Haiku — le bon modèle pour les pipelines à fort volume

Claude 3.5 Haiku est probablement le modèle qui va le plus changer les pipelines IA à court terme. Pour une intégration à fort volume — classification de tickets, enrichissement de données en EventSubscriber Symfony, complétion dans un formulaire — il devient le choix évident quand Sonnet est surdimensionné. Anthropic annonce des performances supérieures à Claude 3 Opus sur plusieurs benchmarks de code et d'analyse, à un tarif nettement plus bas.

# Claude 3.5 Haiku disponible dès le 22/10 — test rapide via curl
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-3-5-haiku-20241022",
    "max_tokens": 64,
    "messages": [
      {
        "role": "user",
        "content": "Classe ce ticket en une catégorie parmi [facturation, accès, bug, autre] : \"Mon compte est bloqué depuis hier matin.\""
      }
    ]
  }'

Le modèle complet (claude-3-5-sonnet-20241022) reste pertinent pour la génération de code complexe, le raisonnement multi-étapes et la résolution de bugs — d'où le bond sur SWE-bench. Pour les tâches à fort volume et latence sensible dans un contexte Symfony/Messenger, Haiku 3.5 offre le meilleur ratio coût/qualité/vitesse.

Le 22 octobre 2024 marque une rupture symbolique : pour la première fois, un modèle frontier peut agir sur une interface graphique arbitraire sans instrumentation dédiée. La bêta est rugueuse, les limitations sont documentées, mais la trajectoire est lisible. Si tu veux évaluer concrètement ce que ces nouvelles capacités changent pour ton stack — automatisation d'interfaces legacy, intégration IA dans tes workflows Messenger, réduction de la dette de scripting — c'est exactement le terrain d'un accompagnement CTO externalisé : on cadre les cas d'usage qui ont du sens avant d'investir du temps d'intégration.

Cet article vous a plu ? Partagez-le !

Votre équipe utilise Claude Code ?

Workshop intensif : votre équipe opérationnelle en 1 jour.