La startup DeepSeek llança un model experimental d'interpretació d'imatges, DeepSeek-V4-Flash-Vision-Exp, accessible gratis via API i amb un rendiment que, segons els seus creadors, competeix amb els pesos pesants del sector.
DeepSeek-V4-Flash-Vision-Exp: Visió d'IA a l'abast de tothom
Mentre els gegants de la intel·ligència artificial competeixen per la supremacia en models de llenguatge i agents, la startup DeepSeek ha donat un cop de gràcia amb el llançament del seu model experimental DeepSeek-V4-Flash-Vision-Exp. Aquest nou contrincant, disponible de forma gratuïta a través de la seva API, promet una capacitat d'interpretació d'imatges que, segons la companyia, s'acosta perillosament al rendiment de models de frontera com Claude Opus 4.8.
La jugada és audaç. DeepSeek-V4-Flash-Vision-Exp no només és capaç de processar contingut visual, cosa que fins ara només feia la família DeepSeek-VL, sinó que manté el preu de la seva versió de només text, és a dir, cost zero per als desenvolupadors que l'integrin via API. És un moviment que busca democratitzar l'accés a la visió multimodal en un moment on les barreres d'entrada, tant econòmiques com tècniques, solen ser elevades.
Què ofereix aquest nou model?
- Interpretació d'imatges gratuïta: Accessible sense cost addicional a través de l'API, un punt clau per a desenvolupadors i empreses amb pressupostos ajustats.
- Capacitats multimodals: Processa imatges en formats comuns com JPEG, PNG, GIF i WebP, acceptant fins a 600 imatges per petició.
- Rendiment competitiu: Els seus creadors afirmen que el seu nivell de raonament i coneixement general, fins i tot en tasques visuals, s'equipara al de la versió de només text, fregant la capacitat de models com Claude Opus 4.8.
- Habilitats d'agent: Hereda les capacitats d'agent dels seus predecessors, permetent interpretar imatges i executar tasques sense supervisió directa.
Aquest llançament no és un simple avanç tècnic; és una declaració d'intencions. DeepSeek, que ja el 2025 va demostrar la seva estratègia de trencar la baralla de preus, repeteix jugada en un terreny que semblava reservat a OpenAI i Anthropic. El dubte no és tant si el model és bo, sinó quin impacte tindrà en la dinàmica de preus i accessibilitat del mercat de la IA.
“La visió multimodal gratuïta de DeepSeek no només és un avanç tècnic, és un catalitzador que obligarà els grans a repensar les seves estratègies de preus i democratització de la IA.” — Un analista de la indústria tecnològica.
És important recordar, com adverteixen els mateixos creadors, que es tracta d'un model experimental i que els benchmarks propis sempre s'han de prendre amb cautela. No obstant això, si DeepSeek-V4-Flash-Vision-Exp aguanta el contacte amb la realitat, podria forçar els líders del sector a moure fitxa, accelerant la cursa per oferir capacitats avançades a costos més accessibles.
LaIA de VilaTec