Ich werde am Mittwoch (23.9.2026) einen kleinen #Workshop zum Thema
LLMs/#KI und #SemantischeSuche auf dem “#AI in RSE” Workshop halten, der dieses Mal in #Göttingen stattfindet. Ich würde mich freuen Menschen aus dem #Fediverse dort zu treffen! 🙂
Follow #llm from Mastodon or any other Fediverse app and its public posts arrive in your timeline. No vutuv account needed.
@llm@tags.vutuv.de
17 posts
Ich werde am Mittwoch (23.9.2026) einen kleinen #Workshop zum Thema
LLMs/#KI und #SemantischeSuche auf dem “#AI in RSE” Workshop halten, der dieses Mal in #Göttingen stattfindet. Ich würde mich freuen Menschen aus dem #Fediverse dort zu treffen! 🙂
#Steady #Klimacrew
Wenn #Sprachmodelle plötzlich menschenverachtende Aussagen treffen oder gefährliche Tipps geben, läuft etwas gewaltig schief.
Eine aktuelle Untersuchung zeigt, wie schnell #Feintuning unerwartete Folgen haben kann – mit brisanten Konsequenzen für reale Anwendungen.
Das Phänomen wurde nur durch Zufall entdeckt.
A handful of bros in Silicon Valley and Wall Street have wagered much of the global economy on being able to hyperscale stochastic parrots into AGI super beings.
Many in the know have long known that is a losing bet as LLMs are mathematically guaranteed to produce plausible sounding errors (too often called “hallucinations”). Sucking up increasing amounts of water and energy to train on more stolen information only results in marginal improvements.
All this talk of ‘needing to slow down the super scary AI’ is just a tacit admission from the AI CEOs that they are running out of venture capitalist marks to con and are looking for a government bailout - it’s only fair to be compensated if they are tapping the breaks to save humanity, after all.
These AI companies have no path to profitability (unless LLM to AGI transition is, in fact, possible and around the corner, to which it’s not), but can find a ‘nice’ home within increasingly fascist surveillance states.
These: Ohne eine abgestimmte europäische LLM-Politik werden wir zwischen den USA und China zerrieben.
Wir können endlos darüber diskutieren, dass die Geschäftsmodelle von OpenAI und Anthropic nicht tragfähig sind.
Aber Fakt ist auch, dass LLMs nicht verschwinden werden, selbst wenn beiden Firmen Pleite gehen sollten.
Ja, es gibt Leute, die weiterhin der Meinung sind, dass LLMs nutzlos wären.
Das halte ich aber für eine Position, die von der Realität nicht gedeckt ist.
Natürlich wird viel Mist mit LLMs gemacht und möglicherweise ist auch der größte Teil dessen, was mit LLMs derzeit produziert wird, Müll.
Aber deswegen sind LLMs nicht nutzlos, denn mit der gleichen Begründung könnte ich das gesamte Internet für nutzlos erklären, denn ich behaupte, dass im gesamten Internet der meiste Traffic weitgehend Müll ist.
Und niemand wird wohl ernsthaft den Nutzen des Internets in Frage stellen.
Auch die ökologische Wirkung ist derzeit ein Desaster.
Aber auch hier: Die sogenannten sozialen Netzwerke sind durch Meta/TikTok/X & Co. auch eine gesellschaftspolitische Katastrophe.
Trotzdem fordert fast niemand ernsthaft deren kollektive Abschaltung, noch wäre dies realistisch überhaupt umsetzbar.
Die Liste der Probleme lässt sich noch lange fortführen …
Es ändert aber alles nichts auf Ausgangsthema.
Also zurück dahin: Sofern wird nicht nur Zuschauer sein wollen und uns komplett von China und den USA abhängig machen wollen, müssen wir eine gemeinsame europäische Antwort suchen, wie wir selbst in diesem Umfeld agieren und bestehen wollen. Denn allein, sind die europäischen Staaten viel zu schwach, um auch nur erst genommen zu werden.
Benchmarks sind eine wichtige und akzeptierte Evaluierungsstrategie im Bereich LLM / KI.
Jetzt gibt es einen Benchmark für eine neue Kategorie: cybercrimebench.com
It’s CheapSeek time again:
Verfügbarkeiten:
Und die ersten etwas besseren Leaderboard-Einträge: artificialanalysis.ai/leaderboards/…
Etwas weniger fähig als GLM5.3-Flash/Ox-Alpha, dafür doppelt so schnell.
It’s CheapSeek time again:
Verfügbarkeiten:
Good deck by Greg KH on using local LLMs to find and address bugs/defects in the Linux kernel: hosted-files.sched.co/osskorea2026/…
KW 36: Ich habe noch immer einen Job, obwohl ich KI einsetze
Einige Wochen nach meinem Post “KW 29: Kurzer Erfahrungsbericht aus der Entwicklung” entwickle ich immer noch Software und wurde nicht vollständig von der KI ersetzt 😁️
Wenn eine Nicht-Entwickler:in mit Hilfe eines LLM eine Aufgabe lösen kann, für die sie zuvor eventuell Stunden gebraucht hätte, um etwas “von Hand” zu erledigen, ist das eines dieser Beispiele, mit denen sich der Einsatz von KI an vielen Arbeitsplätzen lohnen kann. In natürlicher Sprache zu beschreiben, was wir von der Maschine erwarten, fällt uns Menschen recht einfach. Darin sehe ich einen großen Vorteil für viele “lästige” Aufgaben.
Unternehmenskritische Prozesse lassen sich selten in wenigen Sätzen erklären. Die Angabe von miteinander verknüpften Aufgaben wird zudem häufig regulatorisch begleitet. Und zudem sind auch Sicherheits- und Datenschutzanforderungen einzuhalten, die im gesamten Unternehmen gleich behandelt werden müssen.
An dieser Stelle kommen nach meiner Auffassung Expert:innen ins Spiel, die ihr Handwerk gelernt haben und den LLMs Vorgaben machen können, die für die Umsetzung von Prozessen in Software zwingend eingehalten werden müssen.
Die Vorgaben haben wir in der Softwareentwicklung auch schon zuvor gemacht, wenn wir in Teams die Quellcodezeilen von Hand geschrieben haben. Architektur-Dokumentation, Requirements in Ticket-Systemen, Dokumente zum Risikomanagement, Coding Guidelines, Kataloge von vertrauenswürdiger Dritt-Software sind schon lange unsere Begleiter, wenn wir Software schreiben. Wir wollen in Teams gleichbleibende Qualität abliefern und machen uns daher viele Gedanken dazu, was wir dafür tun und wie wir es belegen können.
In vielen Unternehmen werden die Budgets für die Software-Entwicklung in den letzten Jahren wieder stärker auf den Prüfstand gestellt. Entwicklungsabteilungen werden verkleinert. Die Vergabe von Entwicklungsaufgaben an Dienstleister zurückgefahren. Dennoch soll nicht darauf verzichtet werden, dass die eigenen Prozesse in Software überführt werden.
Ich verstehe daher die KI immer mehr als Team-Mitglied. Gerade wenn das Team immer kleiner wird, aber die Anzahl der Aufgaben auf einem hohen Niveau bleibt, braucht es stärkere Unterstützung.
Die Expertise, die nun also in den Vordergrund gerückt wird, ist die Erstellung der Dokumentation, die die Grundlage für die Softwareentwicklung bietet und der Umgang mit den KI-Werkzeugen, um Produkte zu entwickeln, die Nutzer:innen gerne einsetzen.
Die Expert:innen, die wir in Zukunft brauchen werden, müssen immer noch ein Verständnis für die Technik haben. Die Ausbildung dieser Fachkräfte muss uns immer noch einiges Wert sein. Reine Programmierer:innen, die nur noch die Codezeilen heruntertippen, wird es vermutlich immer weniger geben. Ausnahmen wird es indes immer geben.
Die Ox Alpha Story wiederholt sich, diesmal heißt es Omen Alpha. Allerdings nicht direkt in Opencode Zen (d.h. komplett umsonst), sondern in der 10$ Subscription wo es dann 100$ für 10$ liefert laut Tabelle. Und das beste was es sonst an OpenWeight gibt mit ZDR laut Opencode-Doku und API-Key zur freien Verwendung.
startupfortune.com/opencodes-mystery-om…
Resultat sieht aber ganz ok aus bis jetzt. Kann auch anständige SVGs. Schnell ist es auch.
Wie immer und was der Artikel auch sagt: Das ist ein non-on-prem Stealth-Modell, insofern also vorsichtig mit sensitiven Daten und alle Regeln beachten.
Und es gibt GLM5.3-Flash (aka Ox Alpha) aktuell in einer Aktion noch etwas billiger als Omen Alpha
(Subscription Link ist Referallink; etwas Modellguthaben geht in beide Richtungen).
Replying to @reeeen@norden.social
Nahezu ausschliesslich mittlerweile. Fähigkeit einfach das Modell+Harness den Quellcode vom Harness lesen zu lassen um herauszufinden was der Harness wirklich macht ist Gold wert.
Plugin System grandios. Feature fehlt? Feature is doof? Bau ein, bau besser.
Natürlich mit dem eingebautem Web-Interface wenn man gerade keine Lust auf die TUI hat. Client/Server fähig um lokales TUI mit entferntem Coding Server zu verbinden. Beliebig in andere Apps oder sogar shell scripts integrierbar.
Dazu natürlich das grandiose Anomaly/Opencode Go 10€/Monat Paket.
Jeden Monat das beste was es an Openweight Modellen gibt mit in der Regel mehr als großzügigen Limits, ZDR (Zero Data Retention) und regelmäßig free token Aktionen bei neuen Modellen. Ganze Woche 8h/Tag straight Ox Alpha/GLM 5.3 Flash für umsonst zur Einführung mit ZDR bekommen. Davor das gleiche als DeepSeek V4 Flash neu war. Absoluter No-Brainer.
(Link oben ist ref-Link: 1. Monat 5€ statt 10€ und 5€ für mich.)
2 likes 1 reply
@reeeen@norden.social liked this @eutechnews@mastodon.social liked this
Already counted in the numbers above.
Interessantes Paper zum Einfluss von AGENTS.md et al. Dateien.
arxiv.org/pdf/…
Wichtiger Quote aber auch:
Limitations and Future Work Programming languages The current evaluation is focused on Python. Since this is a language that is widely represented in the training data, detailed knowledge about tooling, dependencies, and other repository specifics might be present in the models’ parametric knowledge, nullifying the effect of context files. Future work may investigate the effect of context files on more niche programming languages and toolchains that are less represented in the training data [8, 27].Context files beyond task resolution In this work, we evaluate the impact of context files on task resolution rate. However, other aspects of coding agent performance, such as code efficiency [14] and security [10], would be interesting directions for future work. Security, specifically, was found to be sensitive to prompt changes in prior work [37].
Hervorhebung eigene.
Im Prinzip also: Spitz, nützlich und was das Modell halt nicht selbst kann reinschreiben, nicht was Captain Obvious auch schon gewusst hätte. Whowouldathought. Klingt wie bei Menschen…😆
Spannende neue Ergebnisse von Intel was low(er) power KI-Beschleuniger angeht.
Ich finde das auch insbesondere vor dem Hintergrund der Mac/AMD395-/Nvidia DGX Serie Alternativen interessant. Schöne KPI auch: Token/W.
480GB oder selbst 160GB sollten mit ausreichend Bandbreite und Leistung schon einiges erreichen konnen.
Cosa fa il tirannosauro qui sotto? Divora #libri distruggendoli
È il logo del dipartimento di #Amazon che fa a pezzi libri rari per alimentare gli #LLM#404 media ha dimostrato che la pratica di acquisire libri rari e distruggerli è reale e non una leggenda: è bastato inserire un #airtag in un libro per tracciarlo.
La cosa è stata definita “incarnazione del male”. Chiunque sappia cosa sia davvero un libro non può che essere d’accordo.
Das ganze “digitale Souveranität” Thema wird immer gerne rumgereicht. Und für KI wirds ebenso so wichtig, wenn nicht wichtiger. Leider ist Deutschland hier auch wieder kurz vor abgehängt. Aber…
@hetzner@mastodon.hetzner.social to the rescue. Da scheint gerade die Aufbau-Phase fürs Inference-Only Hosting mit OpenWeight-Modellen zu laufen. Aktuell Qwen 3.6 und das aktuelle Qwen 3.8.
Und in dem Zusammenhang gibt’s aktuell eine kostenlose Testphase mit Free-Tokens: docs.hetzner.com/general/…
Qwen 3.8 scheint unter der Last zusammengebrochen zu sein, 3.6 reagiert.
OpenCode hat es schon als direkt verwendbaren Provider integriert.
Fragt sich ob das mit ZDR (Zero Data Retention) läuft und wie die zukünftigen Pläne für Flatrates, ZDR, andere Modelle wie DeepSeek V4 Flash und dergleichen aussehen. Sie sind an Feedback interessiert, sagt die Website.
OpenAI-Modell bricht aus Sandbox aus, hackt Hugging Face, um bei einem eigenen Test zu schummeln. Klingt nach Fiktion, ist aber offiziell bestätigt (von OpenAI selbst).
Wir haben den Vorfall aufgedröselt – inklusive der Ironie, dass kommerzielle KI-Modelle sich weigerten, bei der Aufklärung zu helfen, weil ihre eigenen Sicherheitsfilter den Angriff für echt hielten.
“offiziell bestätigt” und dann steht da als Quelle “OpenAI” – die #LLM-Unternehmen behaupten viel, wenn es ihnen nützt. Und zu “bestätigen”, dass ein Modell so mächtig ist, dass es aus einer Sandbox ausbricht, macht den Leuten zwar Angst, aber es verbreitet auch weiter den Narrativ, dass wir bald bei #AGI angelangt seien (jakecuth.com/work/…). Und mit der Angst kann man auch wiederum gut arbeiten (“Wollt ihr, dass den Chinesen lieber die Macht über den #KI-Markt überlassen oder wollt ihr lieber uns mehr Macht geben?”).