99精品伊人亚洲|最近国产中文炮友|九草在线视频支援|AV网站大全最新|美女黄片免费观看|国产精品资源视频|精彩无码视频一区|91大神在线后入|伊人终合在线播放|久草综合久久中文

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

微軟視覺語言模型有顯著超越人類的表現(xiàn)

如意 ? 來源:cnBeta.COM ? 作者:cnBeta.COM ? 2021-01-19 14:32 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

視覺語言(Vision-Language,VL)系統(tǒng)允許為文本查詢搜索相關圖像(或反之),并使用自然語言描述圖像的內容。一般來說,一個VL系統(tǒng)使用一個圖像編碼模塊和一個視覺語言融合模塊。微軟研究部門最近開發(fā)了一種新的圖像編碼對象屬性檢測模型,稱為VinVL(Visual features in Vision-Language),有著顯著超越人類的表現(xiàn)。

當VinVL與OSCAR和vivo等VL融合模塊結合后,微軟新的VL系統(tǒng)能夠在競爭最激烈的VL排行榜上取得第一,包括視覺問題回答(VQA)、微軟COCO圖像字幕和新穎對象字幕(nocaps)。微軟研究團隊還強調,在nocaps排行榜上,這種新的VL系統(tǒng)在CIDEr(92.5對85.3)方面的表現(xiàn)明顯超過了人類的同形式表現(xiàn)。

微軟解釋道:

VinVL在改善VL理解的圖像編碼方面表現(xiàn)出了巨大的潛力。我們新開發(fā)的圖像編碼模型可以使廣泛的VL任務受益,正如本文中的例子所說明的那樣。盡管我們獲得了很有希望的結果,比如在圖像字幕基準上超越了人類的表現(xiàn),但我們的模型絕不是達到VL理解的人類水平的智能。未來有趣的工作方向包括 (1)利用海量圖像分類/標記數(shù)據,進一步擴大對象屬性檢測預訓練的規(guī)模;(2)將跨模態(tài)VL表征學習的方法擴展到構建感知基礎的語言模型,可以像人類一樣將視覺概念建立在自然語言中,反之亦然。

微軟VinVL正在被整合到Azure認知服務中,Azure認知服務為微軟的各種服務提供支撐,如Seeing AI、Office和LinkedIn中的圖像字幕等。微軟研究團隊還將向公眾發(fā)布VinVL模型和源代碼。
責編AJX

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 微軟
    +關注

    關注

    4

    文章

    6686

    瀏覽量

    105786
  • 圖像
    +關注

    關注

    2

    文章

    1094

    瀏覽量

    41290
  • 模型
    +關注

    關注

    1

    文章

    3521

    瀏覽量

    50445
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關推薦
    熱點推薦

    ?VLM(視覺語言模型)?詳細解析

    視覺語言模型(Visual Language Model, VLM)是一種結合視覺(圖像/視頻)和語言(文本)處理能力的多模態(tài)人工智能
    的頭像 發(fā)表于 03-17 15:32 ?4142次閱讀
    ?VLM(<b class='flag-5'>視覺</b><b class='flag-5'>語言</b><b class='flag-5'>模型</b>)?詳細解析

    TeleAI提出COPO對齊方法:8B模型超越Llama3-70B的表現(xiàn)

    新大陸。 正如人類在面對未知時展現(xiàn)出的探索行為,在人工智能領域,尤其在大型語言模型(LLMs)理解語言和知識中,研究人員正嘗試賦予 LLM 類似的探索能力,從而突破其在給定數(shù)據集中學習
    的頭像 發(fā)表于 02-17 17:31 ?428次閱讀
    TeleAI提出COPO對齊方法:8B<b class='flag-5'>模型</b><b class='flag-5'>超越</b>Llama3-70B的<b class='flag-5'>表現(xiàn)</b>

    一文詳解視覺語言模型

    視覺語言模型(VLM)是一種多模態(tài)、生成式 AI 模型,能夠理解和處理視頻、圖像和文本。
    的頭像 發(fā)表于 02-12 11:13 ?1768次閱讀
    一文詳解<b class='flag-5'>視覺</b><b class='flag-5'>語言</b><b class='flag-5'>模型</b>

    Hugging Face推出最小AI視覺語言模型

    ,SmolVLM-256M-Instruct僅有2.56億參數(shù),是有史以來發(fā)布的最小視覺語言模型,可在內存低于1GB的PC上運行并提供卓越性能。SmolVLM-500M-Instruct
    的頭像 發(fā)表于 01-24 14:15 ?971次閱讀

    語言模型管理的作用

    要充分發(fā)揮語言模型的潛力,有效的語言模型管理非常重要。以下,是對語言模型管理作用的分析,由AI部
    的頭像 發(fā)表于 01-02 11:06 ?390次閱讀

    馬斯克預言:AI將全面超越人類智力

    近日,科技巨頭馬斯克作出了一個關于人工智能(AI)的大膽預測。他斷言,AI的發(fā)展速度將超乎人類的想象,并將在不久的將來全面超越人類的智力。 馬斯克在X平臺上明確表示,AI的迅猛進步不容忽視。他預測
    的頭像 發(fā)表于 12-28 14:23 ?761次閱讀

    【「大模型啟示錄」閱讀體驗】+開啟智能時代的新鑰匙

    閱讀之旅。在翻開這本書之前,我對大模型的認知僅僅停留在它是一種強大的人工智能技術,可以進行自然語言處理、圖像識別等任務。我知道像 ChatGPT 這樣的應用是基于大模型開發(fā)的,能夠與人類
    發(fā)表于 12-24 13:10

    NaVILA:加州大學與英偉達聯(lián)合發(fā)布新型視覺語言模型

    日前,加州大學的研究人員攜手英偉達,共同推出了一款創(chuàng)新的視覺語言模型——NaVILA。該模型在機器人導航領域展現(xiàn)出了獨特的應用潛力,為智能機器人的自主導航提供了一種全新的解決方案。
    的頭像 發(fā)表于 12-13 10:51 ?690次閱讀

    超越人類視覺!昱感微“多維像素”多模態(tài)超級攝像頭方案產品賦能超凡感知力

    如今人工智能發(fā)展之日新月異,令人不由感嘆也許科幻電影里仿生人的應用不再是遙不可及,那么未來AI會超越人類甚至取代人類嗎?也許現(xiàn)在AI的大腦還無法做到,但眼睛已經做到,機器視覺的感知力已
    的頭像 發(fā)表于 12-12 17:17 ?895次閱讀
    <b class='flag-5'>超越</b><b class='flag-5'>人類</b><b class='flag-5'>視覺</b>!昱感微“多維像素”多模態(tài)超級攝像頭方案產品賦能超凡感知力

    語言模型開發(fā)框架是什么

    語言模型開發(fā)框架是指用于訓練、推理和部署大型語言模型的軟件工具和庫。下面,AI部落小編為您介紹大語言
    的頭像 發(fā)表于 12-06 10:28 ?530次閱讀

    語言模型開發(fā)語言是什么

    在人工智能領域,大語言模型(Large Language Models, LLMs)背后,離不開高效的開發(fā)語言和工具的支持。下面,AI部落小編為您介紹大語言
    的頭像 發(fā)表于 12-04 11:44 ?704次閱讀

    基于視覺語言模型的導航框架VLMnav

    本文提出了一種將視覺語言模型(VLM)轉換為端到端導航策略的具體框架。不依賴于感知、規(guī)劃和控制之間的分離,而是使用VLM在一步中直接選擇動作。驚訝的是,我們發(fā)現(xiàn)VLM可以作為一種無需任何微調或導航數(shù)據的端到端策略來使用。這使得該
    的頭像 發(fā)表于 11-22 09:42 ?800次閱讀

    通義千問發(fā)布第二代視覺語言模型Qwen2-VL

    阿里巴巴旗下的通義千問近日宣布,其第二代視覺語言模型Qwen2-VL正式問世,并宣布旗艦模型Qwen2-VL-72B的API已順利接入阿里云百煉平臺,標志著這一創(chuàng)新技術成果正式對外開放
    的頭像 發(fā)表于 09-03 16:31 ?864次閱讀

    IBM Granite系列模型被Forrester評為“強勁表現(xiàn)者”

    近日,IBM 憑借其旗艦 Granite 系列模型,在 2024年第二季度的《Forrester Wave:語言 AI 基礎模型》報告中,被評為“強勁表現(xiàn)者”。
    的頭像 發(fā)表于 08-16 11:34 ?804次閱讀

    【《大語言模型應用指南》閱讀體驗】+ 基礎知識學習

    、機器翻譯、文本生成等領域具有廣泛應用。它們能夠基于用戶的提問或描述生成相關的答案或執(zhí)行指令,極大地提升了信息檢索和利用的效率。 2. 局限性 盡管大語言模型在自然語言理解方面取得了顯著
    發(fā)表于 08-02 11:03