search icon

Bloomberg

DeepSeek: Από το κείμενο στις εικόνες – Το νέο μοντέλο που ανταγωνίζεται την Anthropic

Η DeepSeek παρουσίασε νέο πειραματικό multimodal μοντέλο AI, ικανό να κατανοεί εικόνες και screenshots και να εκτελεί εργασίες - Η κινεζική εταιρεία υποστηρίζει ότι οι επιδόσεις του προσεγγίζουν το προηγμένο Opus 4.8 της Anthropic

Nikolas Kokovlis / NurPhoto / NurPhoto via AFP

Η DeepSeek διευρύνει τις δυνατότητες της τελευταίας γενιάς μοντέλων τεχνητής νοημοσύνης πέρα από το κείμενο, προσθέτοντας «όραση» στο κορυφαίο V4 Flash. Η κινεζική εταιρεία παρουσίασε την Παρασκευή ένα νέο πειραματικό μοντέλο που μπορεί να κατανοεί εικόνες και screenshots και να αναλαμβάνει ενέργειες με βάση οπτικές πληροφορίες, εντείνοντας τον ανταγωνισμό με τους κορυφαίους Αμερικανούς developers AI.

Το νέο μοντέλο αποτελεί πειραματική εκδοχή του DeepSeek-V4-Flash, το οποίο μέχρι σήμερα επικεντρωνόταν στο κείμενο. Με την προσθήκη multimodal δυνατοτήτων, μπορεί πλέον να επεξεργάζεται διαφορετικές μορφές πληροφορίας και όχι αποκλειστικά γραπτές εντολές.

Η εταιρεία υποστηρίζει ότι το νέο σύστημα διατηρεί τις επιδόσεις του V4 Flash στο κείμενο, συμπεριλαμβανομένων των δυνατοτήτων του σε AI agents, συλλογιστική και γενικές γνώσεις, προσθέτοντας παράλληλα την ικανότητα κατανόησης οπτικού περιεχομένου.

Στόχος το Opus 4.8 της Anthropic

Ιδιαίτερο ενδιαφέρον προκαλεί η σύγκριση που κάνει η ίδια η DeepSeek με την Anthropic. Σύμφωνα με την κινεζική εταιρεία, οι επιδόσεις του πειραματικού μοντέλου βρίσκονται «κοντά» σε εκείνες του προηγμένου Opus 4.8 σε δοκιμές που αξιολογούν τις multimodal agentic δυνατότητες.

Πρόκειται για εργασίες στις οποίες ένα μοντέλο AI δεν περιορίζεται στο να απαντά σε ερωτήσεις, αλλά μπορεί να ερμηνεύει το περιβάλλον του και να πραγματοποιεί ενέργειες με μεγαλύτερο βαθμό αυτονομίας, χωρίς να χρειάζεται συνεχείς οδηγίες από τον χρήστη.

Το νέο μοντέλο ονομάζεται DeepSeek-V4-Flash-Vision-Exp και αποτελεί την πρώτη φορά που οι δυνατότητες κατανόησης εικόνων και εκτέλεσης σχετικών εργασιών ενσωματώνονται στην πλέον προηγμένη σειρά V4 της εταιρείας.

Η DeepSeek έχει παρουσιάσει και στο παρελθόν μοντέλα με δυνατότητες οπτικής κατανόησης, μεταξύ των οποίων η οικογένεια DeepSeek-VL. Η διαφορά τώρα είναι ότι η συγκεκριμένη τεχνολογία ενσωματώνεται στην αιχμή της γκάμας της, συνδυάζοντας τις δυνατότητες του V4 Flash με επεξεργασία οπτικών δεδομένων.

Οι χρήστες μπορούν να αποκτήσουν πρόσβαση στο πειραματικό μοντέλο μέσω του API της DeepSeek.

Νέος γύρος στην κούρσα AI Κίνας – ΗΠΑ

Η παρουσίαση έρχεται σε μια περίοδο κατά την οποία ο ανταγωνισμός μεταξύ κινεζικών και αμερικανικών εταιρειών τεχνητής νοημοσύνης γίνεται ολοένα εντονότερος. Οι κινεζικοί developers επιχειρούν να μειώσουν την απόσταση από τους κορυφαίους αμερικανικούς ομίλους, προσφέροντας μοντέλα με συγκρίσιμες επιδόσεις και συχνά σημαντικά χαμηλότερο κόστος.

Η DeepSeek βρίσκεται στο επίκεντρο αυτής της προσπάθειας. Η κυκλοφορία του flagship μοντέλου της νωρίτερα μέσα στο 2026 αναδιαμόρφωσε τις προσδοκίες για το επίπεδο απόδοσης που μπορούν να προσφέρουν τα χαμηλότερου κόστους και open-weight μοντέλα.

Με το DeepSeek-V4-Flash-Vision-Exp, η εταιρεία επιχειρεί πλέον να επεκτείνει αυτή τη δυναμική στον χώρο των multimodal AI agents, έναν από τους σημαντικότερους νέους άξονες ανταγωνισμού στην τεχνητή νοημοσύνη. Η δυνατότητα ενός μοντέλου να «βλέπει», να κατανοεί τι εμφανίζεται στην οθόνη και στη συνέχεια να εκτελεί εργασίες αυτόνομα θεωρείται κρίσιμο βήμα προς συστήματα AI που μπορούν να αναλαμβάνουν ολοένα πιο σύνθετες ψηφιακές εργασίες.

Διαβάστε επίσης

Το νέο οικονομικό στοίχημα της Gen Z: Μαθαίνουν δεξιότητες για να ξοδεύουν λιγότερα

Aλλάζει ο χάρτης των εξαγωγών πετρελαίου του Κόλπου – Η Aramco στέλνει 4 εκατ. βαρέλια στην Κίνα χωρίς Ορμούζ

ΟΟΣΑ: Η ανεργία των νέων στην Ελλάδα υποχώρησε θεαματικά, αλλά η οικονομική ανεξαρτησία παραμένει δύσκολη (γραφήματα)

Για όλες τις υπόλοιπες ειδήσεις της επικαιρότητας μπορείτε να επισκεφθείτε το Πρώτο ΘΕΜΑ

Exit mobile version