#computer use (2)

Seite 1 von 1

The Pelican comparison grid for Astra is pretty interesting

Nach Fable 5.1 ist in dieser Woche auch GPT-6 Astra erschienen. Simon Willison hat natürlich wieder Pelikane zeichnen lassen und diese dann auch mit OpenAIs GPT-5.6-Vorgängermodellen Sol, Terra, Luna verglichen. Das Span­nende: Nicht nur, dass GPT-6 selbst auf den niedrigeren Reasoning-Levels bessere Ergebnissen liefert als GPT-5.6, nein, sie sind auch noch besser als alles unter dem höchsten Reasoning von Fable 5.1.

Vorschaubild zum Video. Aktivieren, um das Video zu laden und abzuspielen. 
(YouTube Direktlink)

Das Demovideo auf der Astra-Seite, das auch hier drüber eingebunden ist, finde ich übrigens ganz schick. Es zeigt verschiedene Personen, die mal mehr, mal weniger klassische Computer­arbeiten durch natür­liche Sprach­eingabe anwei­sen, woraufhin GPT-6 antwortet und die Aufgaben per Computer Use live um­setzt. Die Computer-Use-Fähigkeit von Codex ChatGPT sind definitiv mein Tech-Feature des Jahres, aber das hier, fürchte ich, ist in diesem Tempo noch Vaporware. Aber ver­mut­lich nicht mehr lange.

The Pelican comparison grid for Astra is pretty interesting | OpenGraph Preview Image
simonwillison.net

The Pelican comparison grid for Astra is pretty interesting

I got access to GPT-6 Astra this afternoon, so naturally I used it to generate SVGs of pelicans riding bicycles—at low, medium, high, xhigh and max reasoning levels (Astra doesn’t …

OpenAI’s new Codex app has the best ‘Computer Use’ feature I’ve ever tested

Federico Vittici über die „Computer Use“-Automati­sierungs­features der neuen Codex-Superapp von OpenAI, in der sie die Mac-Software-Steuerung des letzten Jahr gekauften und zuvor ebenfalls von Federico geteste­ten und gefeier­ten, aber noch nicht releaseten „Sky“ implemen­tiert haben, das von den ehe­maligen Workflow-/Apple-Shortcut-Entwickler gebaut wurde.

Ich habe die bisherige Codex-Nicht-Superapp in den letzten Wochen immer mal wieder für Coding-Tasks heran­gezogen und gute Ergebnisse damit erzielt, insb. wenn ich diese anschließend von einem anderen Modell habe korrigieren lassen, weil das natürlich immer nur 80%-Lösungen waren.1 Die „Computer Use“-Features sind noch nicht in Europa verfügbar, weshalb ich sie selbst­redend noch nicht testen konnte, aber ich hätte bereits zwei, drei konkrete Use Cases, die ich demnächst gerne auspro­bieren würde.

Codex kann hier heruntergeladen werden. Hier steht, wie ihr – außerhalb von Europa – „Computer Use“ aktiviert.

  1. Dafür hat sich übrigens Madman Gemini in Version 3.1 Pro etabliert. Komplete Aufgaben funktionieren für mich besser mit Claude oder eben GPT-Codex, aber für Review und Korrektur ist Gemini echt gut und bisweilen sogar besser. []
OpenAI’s New Codex App Has the Best ‘Computer Use’ Feature I’ve Ever Tested | OpenGraph Preview Image
macstories.net

OpenAI’s New Codex App Has the Best ‘Computer Use’ Feature I’ve Ever Tested