---
title: "Johannes Tigges · 2026-09-10"
description: "Es gibt schon die ersten On-Prem Inference Rezepte: https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash"
url: https://vutuv.de/johannes_tigges/posts/01a08af3-114e-79a1-b0cd-a4daee7b2c7e
type: post
schema_version: 3
generated_at: 2026-09-20T13:06:25Z
---

# Post by [Johannes Tigges](https://vutuv.de/johannes_tigges) · 2026-09-10

> In reply to a post by [Johannes Tigges](https://vutuv.de/johannes_tigges/posts/01a08aef-a526-70c0-857b-db2dcf190a6c).

Es gibt schon die ersten On-Prem Inference Rezepte: https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4.1-Flash 

Und wie es aussieht mit durchaus akzeptabler Hardware.

Tags: #onpreminference, #modelhosting, #vllm, #strixhalo, #mlx

Likes: 0 · Reposts: 0 · Bookmarks: 0

## Conversation (3)

### [Johannes Tigges](https://vutuv.de/johannes_tigges/posts/01a08aef-a526-70c0-857b-db2dcf190a6c) · 2026-09-10

It's CheapSeek time again:

* Announcement, Inferencevendors, Openrouter: https://openrouter.ai/deepseek/deepseek-v4.1-flash
* Weights: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 
* Announcement: https://www.deepseek.com/en/news/deepseek-v4-1-flash/
* Jetzt mit Vision. Soll auf DS4 Pro Level liegen. Je nach Berichten soll es im Opus-Bereich wildern. DS4F war deutlich weniger gefallsüchtig als die Produkte von Anthropic.

\
Verfügbarkeiten:\
- Absurd billig (50% ggü DeepInfra/OpenRouter) bei [OpenCode Go](https://opencode.ai/go?ref=WP0WR5XCPG) (RefLink), absehbar an der Stelle tatsächlich China-hosted, dafür aber zumindest mit [ZDR Zusicherung](https://opencode.ai/docs/go/#privacy). \
\- Sonst zum doppelten Preis mit ZDR bei DeepInfra via OpenRouter. Wird aber zügig auch woanders laufen.: https://opencode.ai/docs/go/\
\- DeepSeek direkt will wie üblich auf den Prompts trainieren, insofern kann man das skippen...

#### [Johannes Tigges](https://vutuv.de/johannes_tigges/posts/01a0908d-f802-7c45-95a7-493e515a96ec) · 2026-09-11

> In reply to a post by Johannes Tigges.

Und die ersten etwas besseren Leaderboard-Einträge: https://artificialanalysis.ai/leaderboards/models?weights=open

Etwas weniger fähig als GLM5.3-Flash/Ox-Alpha, dafür doppelt so schnell.
