Dawn avant l'agent AI Burst: Manus n'est pas assez bon, mais c'est presque l'aube

MSN - 30/03
Manus peut-il soutenir une évaluation de 500 millions de dollars?

Texte | Silicon Valley 101

Début mars de cette année, un produit d'agent d'IA à usage général appelé "Manus" est devenu populaire après sa sortie. À la fin du mois de mars, la société mère de Manus, Butterfly Effec, a été révélée à la recherche d'un nouveau cycle de financement, avec une évaluation cible de plus de 500 millions de dollars.

Étant donné que Manus est à l'étape des tests internes, il est uniquement ouvert à l'utilisation sous forme de codes d'invitation, ce qui a fait des codes d'invitation à des dizaines de milliers de yuan sur des plateformes d'occasion, et d'innombrables développeurs, investisseurs et praticiens alignés pour l'évaluation.

Dans le même temps, l'évaluation de l'industrie du Manus a commencé à être unilatérale et a commencé à avoir de plus en plus de voix de doute et de critique.

D'une part, la controverse sur Manus vient du fait que cette équipe n'a pas de capacités techniques très solides. Claude d'Anthopic utilisé dans le grand modèle et a ensuite coopéré avec Alibaba Tongyi Qianwen. Il a été remis en question comme un produit "enclins à la coquille", et il n'y a pas de seuil. La rhétorique marketing de l'entreprise "Le premier agent d'IA universel du monde" est évidemment faux. La communauté des développeurs internationaux a depuis longtemps des produits d'agent d'IA aussi généraux. Couplé aux mots de modification exagérés précoces de divers médias et auto-médias, il a en fait suscité le dégoût de nombreuses personnes à l'égard du marketing radical manus.

Mais d'un autre côté, certains investisseurs et praticiens ont vu un côté très positif, croyant que Manus est en effet remarquable dans l'interaction des produits. Ils ont souligné qu'il est facile de faire des démos à ce jour et qu'il est difficile de fabriquer un bon produit. Il n'est pas mal d'être audacieux lors de la promotion des startups.

Ce qui est encore plus excitant, c'est que bien que Manus ne soit pas assez bon, cela permet aux gens de voir l'aube à la veille de l'éclosion des applications d'IA.

Dans cet article, parlons de la popularité et de la controverse causées par Manus, de la voie de développement technologique des agents de l'IA, des goulots d'étranglement techniques actuels, de ce qui est un bon produit d'agent d'IA et quand un agent d'IA général viendra-t-il.

01 Évaluation du manus

  • Chapitre 1.1 Développeur Review Manus

Silicon Valley 101 a également obtenu plusieurs codes d'invitation. Les amis de l'équipe l'ont testé, mais l'effet était en effet bien pire que prévu.

Jacob

Silicon Valley 101 Personne de fin de scène en charge:

J'ai utilisé Manus pour trouver la source d'informations dans le manuscrit. Je pense que je suis un peu plus intelligent à propos de GPT, mais il m'a fallu une demi-heure pour terminer le multi-tâches.

Chen Qian

Co-fondateur et gestionnaire vidéo de la Silicon Valley 101:

Je lui ai demandé de m'aider à organiser le storyboard, et j'ai senti que son goût esthétique était comme un stagiaire, et il était coincé dans le storyboard pendant 21 heures quand je faisais le storyboard, mais il était toujours coincé.

Hongjun

Co-fondateur et gestionnaire vidéo de la Silicon Valley 101:

Lorsqu'on lui a demandé à Manus d'organiser le manuel WeChat, il a eu des hallucinations.

Wang Keyi

Chercheur spécial de Silicon Valley 101, directeur de "Création des invités":

Il a compris mes besoins au début, mais il a quitté la ligne au milieu de l'exécution.

Nous avons également invité le développeur des agents d'IA Nathan Wang à évaluer systématiquement Manus. Nathan possède une riche expérience dans les agents de l'IA et le développement des applications de l'IA au cours des deux dernières années. Il espère exprimer les capacités des modèles énergiques, il a donc établi un mécanisme d'évaluation, et ce système peut également évaluer d'autres applications ou modèles. Ce qui suit est quelques-unes des critiques de Nathan:

J'ai principalement trois indicateurs de mesure: "précision", "disponibilité" et "exhaustivité", et sont classés comme cinq tâches: "recherche", "éducation", "vie", "analyse des données" et "travail créatif".

J'ai marqué de 1 à 5 en fonction des performances de chaque indicateur. Plus les performances sont élevées, plus le score est élevé, plus les performances sont élevées, plus le score est faible et a finalement obtenu le score moyen de trois dimensions.

Parlons de la pièce qui le fait bien en premier: 4 points de recherche et 4,5 points en éducation. Les capacités de ces deux parties sont très fortes, avec une grande précision et une fin.

Mais les résultats de ces deux domaines sont en fait conformes à nos attentes, car Chatgpt, Claude et Gemini ont des fonctions de recherche approfondies. Il s'agit en fait de vous aider à trouver diverses informations sur Internet, à laisser le gros modèle l'expliquer en fonction de vos besoins ou à prendre des mesures.

L'architecture Manus AI utilise d'autres modèles, qui seraient Claude et Deepseek-R1. Manus utilisera ces deux modèles pour générer une liste de tâches basée sur les besoins des utilisateurs. Ensuite, Manus peut rechercher via la programmation et Internet, et rechercher le contenu du navigateur comme un humain pour explorer les informations.

D'une manière générale, Manus consiste davantage à obtenir des informations et à le résumer via des outils, des fonctions et des API, ou de l'exprimer aux utilisateurs par le rendu, comme faire une table, exécuter certains programmes, etc.

Mais en plus de la recherche et de l'éducation, Manus a obtenu un score relativement faible dans la vie, l'analyse des données et le plaisir, avec des scores de «vie» de 3,5 points, des scores d'analyse des données de 2,5 points et des scores «amusants» de 2,5 points.

Dans nos tests, le gros problème que Manus a rencontré est que sa capacité à intégrer les informations provenant de différentes sources n'est pas particulièrement forte; La capacité logique et la capacité de synthèse des informations du modèle lui-même ne sont pas suffisantes, et il ne suffit pas de fournir une aide efficace dans l'expérience réelle des utilisateurs.

Ce qui précède est un extrait de la revue de Nathan. Les téléspectateurs qui souhaitent regarder la version complète peuvent regarder la vidéo Silicon Valley 101 ou le compte vidéo WeChat de Nathan "Silicon Valley Ai Pioneer".

Résumons brièvement les capacités de Manus: sur des tâches simples, il donne une forme de produit interactive très soyeuse d'un agent d'IA général. Bien que Nathan estime que ce produit a été réalisé par des entreprises de la communauté des développeurs de la Silicon Valley depuis longtemps, pour les utilisateurs non développeurs 2C, lorsqu'ils voient la page Manus montrant qu'il est vraiment accéléré de regarder des vidéos, de lire des documents et d'accéder à différents sites Web pour rechercher des informations, il fait vraiment du potentiel de "Ai Agent" pour agir en tant que robot dans le monde virtuel et et en aidant les utilisateurs à compléter une série de Tasks pour le premier temps. C'est toujours incroyable.

Bien sûr, il ne termine pas bien les tâches légèrement difficiles, et devient même coincé pendant des dizaines d'heures, indiquant qu'il est ...
[Courte citation de 8% de l'article original]

Loading...