ChatGPT Pro: OpenAI hat o1 und o1-pro-mode vorgestellt. Beide Modelle sind in dem neuen 200$ teuren Pro-Plan enthalten. Dabei erhält das System im pro-mode mehr Ressourcen und Zeit für die Antwort, wodurch diese besser ausfallen sollen. o1 erstellt, wie schon o1-preview, eigene Aufgaben und teilt die Aufgabe in Schritte auf. Dadurch werden auch komplexere Antworten möglich. openai.com

Abstimmung: OpenAI öffnet auch das Reinforcement Finetuning Programm. Entwickler und Forscher sollen so einfacher bestehende Modelle auf besondere Bedürfnisse anpassen können. Die Bewerbung für das Programm steht nun jedem offen und soll weiter ausgebaut werden. openai.com

Untertitel: Seit den 70er Jahren gibt es für Bewegtbilder die ersten Untertitel. Die Verwendung hat insgesamt zugenommen, da diese auch an lauten Orten helfen, das Gesagte zu verstehen. Google hat eine verbesserte Version vorgestellt, mit der auch Emotionen, Ausdrücke und Hintergrundgeräusche automatisch eingefügt werden. blog.google

Spielwelt: Genie 2 von Googles Deepmind Forschungsgruppe stellt den nächsten Schritt in Richtung einer simulierten Spielwelt dar. Genie 2 kann konsistente und begehbare Spielwelten erstellen. Aktuell ist das Modell auf 1 Minute beschränkt, aber die Möglichkeiten sind deutlich gestiegen. deepmind.google

Welten: Ähnliches kann World Labs AI welches aus einem Bild eine interaktive 3D-Szene erstellt. Das Modell hat dabei noch Schwierigkeiten mit der Konsistenz der Welt und anderen Artefakten. Bis zum eigenen Computerspiel mithilfe eines Prompts ist es noch ein langer Weg. techcrunch.com

Kostenlos: Grok, der Chatbot von x (vormals Twitter) ist ab sofort kostenlos verfügbar. Wer Grok schon immer mal ausprobieren wollte, erhält so die Möglichkeit. Für Grok 2 muss weiterhin ein Abo abgeschlossen werden. theverge.com

Günstiger: Meta hat die neueste Version seines Open-Source-Modells Llama 3.3 70B vorgestellt. Damit lassen sich Ergebnisse ähnlich zu Llama 3.1 405B erzielen. Durch die deutliche Ressourceneinsparung vergrößern sich so die Einsatzmöglichkeiten und reduzieren sich die Kosten. techcrunch.com

Bildbeschreibung: Google hat ebenfalls eine weitere Version seines Open-Source-Modells PaliGemma veröffentlicht. Mit Version 2 verbessert sich die Fähigkeiten zur Beschreibung von Bildern. So werden die Details besser und auch Texte und Formel sollen erkannt werden. developers.googleblog.com

Wetter: GenCast kann das Wetter und das Risiko von Extrembedingungen vorhersagen. Dabei schneidet es insgesamt besser ab als vorhandene Wettermodelle. Die Vorhersagen reichen bis zu 15 Tage in die Zukunft und können deutlich schneller erstellt werden. deepmind.google

Amazon: Obwohl Amazon sehr viel Geld in Anthropic investiert hat, entwickelt das Unternehmen eigene KI-Modelle. Gleich sechs verschiedene Modelle wurden vorgestellt und sind teilweise schon für Entwickler verfügbar. Neben Sprachmodellen sind auch Bild- und Videomodelle dabei. aboutamazon.com

Stimmung: Mit Hume könnt Ihr Texte vertonen. Mit der neuen Funktion "Voice Control" kann man nun dem gesprochenen Wort eine Stimmung verpassen. In 10 verschiedenen Arten lässt sich somit die Stimme an die eigenen Bedürfnisse des Textes anpassen. hume.ai

Video: OpenAI soeben Sora endlich freigegeben. Als Plus und Pro Abonnenten könnt Ihr jetzt Videos erstellen und diese auch nachträglich bearbeiten, Dinge verändern oder als Endlosschleife umbauen. Ich bin sehr gespannt auf eure Kreationen, falls du es schon getestet hast, würde mich dein Feedback und deine Videos dazu sehr freuen. openai.com

Das Jahr strengt sich noch mal an und versorgt uns mit vielen neuen Tools und Funktionen. Vonseiten der KI-Welt liegt also schon jetzt viel unter dem Weihnachtsbaum, was man zwischen den Tagen ausprobieren kann.

Ich freue mich darauf und auf die nächste Ausgabe des AI-Breakdowns.