那曲檬骨新材料有限公司

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內(nèi)不再提示

利用TRansformer進行端到端的目標檢測及跟蹤

3D視覺工坊 ? 來源:計算機視覺研究院 ? 2023-04-18 09:12 ? 次閱讀

現(xiàn)存的用檢測跟蹤的方法采用簡單的heuristics,如空間或外觀相似性。這些方法,盡管其共性,但過于簡單,不足以建模復雜的變化,如通過遮擋跟蹤。

1

簡要

多目標跟蹤(MOT)任務的關鍵挑戰(zhàn)是跟蹤目標下的時間建模。現(xiàn)存的用檢測跟蹤的方法采用簡單的heuristics,如空間或外觀相似性。這些方法,盡管其共性,但過于簡單,不足以建模復雜的變化,如通過遮擋跟蹤。所以現(xiàn)有的方法缺乏從數(shù)據(jù)中學習時間變化的能力。

ddad6866-dd74-11ed-bfe3-dac502259ad0.png

在今天分享中,研究者提出了第一個完全端到端多目標跟蹤框架MOTR。它學習了模擬目標的長距離時間變化。它隱式地執(zhí)行時間關聯(lián),并避免了以前的顯式啟發(fā)式方法。MOTR建立在TRansformer和DETR之上,引入了“跟蹤查詢”的概念。每個跟蹤查詢都會模擬一個目標的整個跟蹤。逐幀傳輸和更新,以無縫地執(zhí)行目標檢測和跟蹤。提出了時間聚合網(wǎng)絡Temporal aggregation network)結合多框架訓練來建模長期時間關系。實驗結果表明,MOTR達到了最先進的性能

2

簡單背景

多目標跟蹤(MOT)是一種視覺目標檢測,其任務不僅是定位每一幀中的所有目標,而且還可以預測這些目標在整個視頻序列中的運動軌跡。這個問題具有挑戰(zhàn)性,因為每一幀中的目標可能會在pool environment中被遮擋,而開發(fā)的跟蹤器可能會受到長期和低速率跟蹤的影響。這些復雜而多樣的跟蹤方案在設計MOT解決方案時帶來了重大挑戰(zhàn)。

ddb96274-dd74-11ed-bfe3-dac502259ad0.png

對于基于IoU的方法,計算從兩個相鄰幀檢測到的檢測框的IoU矩陣,重疊高于給定閾值的邊界框與相同的身份相關聯(lián)(見上圖(a))。類似地,基于Re-ID的方法計算相鄰幀的特征相似性,并將目標對與高相似性相關起來。此外,最近的一些工作還嘗試了目標檢測和重識別特征學習的聯(lián)合訓練(見上圖(b))。

由于DETR的巨大成功,這項工作將“目標查詢”的概念擴展到目標跟蹤模型,在新框架中被稱為跟蹤查詢。每個跟蹤查詢都負責預測一個目標的整個跟蹤。如上圖(c),與分類和框回歸分支并行,MOTR預測每一幀的跟蹤查詢集。

3

新框架分析

最近,DETR通過采用TRansformer成功地進行了目標檢測。在DETR中,目標查詢,一個固定數(shù)量的學習位置嵌入,表示一些可能的實例的建議。一個目標查詢只對應于一個使用bipartite matching的對象。考慮到DETR中存在的高復雜性和慢收斂問題,Deformable DETR用多尺度deformable attention取代了self-attention。為了展示目標查詢?nèi)绾瓮ㄟ^解碼器與特征交互,研究者重新制定了Deformable DETR的解碼器。

ddbfda64-dd74-11ed-bfe3-dac502259ad0.png

MOTR

在MOTR中,研究者引入了跟蹤查詢和連續(xù)查詢傳遞,以完全端到端的方式執(zhí)行跟蹤預測。進一步提出了時間聚合網(wǎng)絡來增強多幀的時間信息。

ddc6430e-dd74-11ed-bfe3-dac502259ad0.png

DETR中引入的目標(檢測)查詢不負責對特定目標的預測。因此,一個目標查詢可以隨著輸入圖像的變化而預測不同的目標。當在MOT數(shù)據(jù)集的示例上使用DETR檢測器時,如上圖(a),相同檢測查詢(綠色目標查詢)預測兩個不同幀預測兩個不同的目標。因此,很難通過目標查詢的身份來將檢測預測作為跟蹤值聯(lián)系起來。作為一種補救措施,研究者將目標查詢擴展到目標跟蹤模型,即跟蹤查詢。在新的設計中,每個軌跡查詢都負責預測一個目標的整個軌跡。一旦跟蹤查詢與幀中的一個目標匹配,它總是預測目標,直到目標消失(見上圖(b))。

ddd03396-dd74-11ed-bfe3-dac502259ad0.png

Overall architecture of the proposed MOTR

Query Interaction Module

在訓練階段,可以基于對bipartite matching的GTs的監(jiān)督來實現(xiàn)跟蹤查詢的學習。而對于推斷,研究者使用預測的軌跡分數(shù)來確定軌道何時出現(xiàn)和消失。

dddc4938-dd74-11ed-bfe3-dac502259ad0.png

Overall Optimization

我們詳細描述下MOTR的訓練過程。給定一個視頻序列作為輸入,訓練損失,即track loss,是逐幀計算和逐幀生成的預測??倀rack loss是由訓練樣本上的所有GT的數(shù)量歸一化的所有幀的track loss的總和:

dde3c58c-dd74-11ed-bfe3-dac502259ad0.png

單幀圖像Lt的track loss可表示為:

dde90a24-dd74-11ed-bfe3-dac502259ad0.png

4

實驗

ddf1574c-dd74-11ed-bfe3-dac502259ad0.png

Implementation Details

All the experiments are conducted on PyTorch with 8Tesla V100 GPUs. We use the Deformable-DETR withResNet50 as our basic network. The basic network ispretrained on the COCO detection dataset.We trainour model with the AdamW optimizer for total 200 epochswith the initial learning rate of 2.0 · 10?4. The learning ratedecays to 2.0 · 10?5 at 150 epochs. The batch size is set to1 and each batch contains 5 frames.

ddfda3a8-dd74-11ed-bfe3-dac502259ad0.png

The effect of multi-frame continuous query passing on solving ID switch problem. When the length of video sequence is setto two (top), the objects that are occluded will miss and switch the identity. When improving the video sequence length from two to five(bottom), the track will not occur the ID switch problem with the help of enhanced temporal relation.

de2b7882-dd74-11ed-bfe3-dac502259ad0.png






審核編輯:劉清

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學習之用,如有內(nèi)容侵權或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 解碼器
    +關注

    關注

    9

    文章

    1148

    瀏覽量

    40935
  • 檢測器
    +關注

    關注

    1

    文章

    869

    瀏覽量

    47785
  • MOT
    MOT
    +關注

    關注

    0

    文章

    18

    瀏覽量

    6977

原文標題:利用TRansformer進行端到端的目標檢測及跟蹤(附源代碼)

文章出處:【微信號:3D視覺工坊,微信公眾號:3D視覺工坊】歡迎添加關注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏

    評論

    相關推薦

    自動駕駛技術研究與分析

    編者語:「智駕最前沿」微信公眾號后臺回復:C-0450,獲取本文參考報告:《自動駕駛行業(yè)研究報告》pdf下載方式。 自動駕駛進入2024年,
    的頭像 發(fā)表于 12-19 13:07 ?316次閱讀

    在自動泊車的應用

    與城市環(huán)境的復雜性和高速公路駕駛的風險相比,停車場景的特點是低速、空間有限和高可控性。這些特點為在車輛中逐步部署自動駕駛能力提供了可行的途徑。最重要的是自動泊車對時間不敏感,而自動駕駛幀率至少
    的頭像 發(fā)表于 12-18 11:38 ?448次閱讀
    <b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>在自動泊車的應用

    已來,智駕仿真測試該怎么做?

    智駕方案因強泛化能力、可持續(xù)學習與升級等優(yōu)勢備受矚目,但這對仿真測試帶來了巨大挑戰(zhàn)。康謀探索了一種有效的
    的頭像 發(fā)表于 12-04 09:59 ?2763次閱讀
    <b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>已來,智駕仿真測試該怎么做?

    爆火的如何加速智駕落地?

    編者語:「智駕最前沿」微信公眾號后臺回復:C-0551,獲取本文參考報告:《智能汽車技術研究報告》pdf下載方式。 “
    的頭像 發(fā)表于 11-26 13:17 ?388次閱讀
    爆火的<b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>如何加速智駕落地?

    連接視覺語言大模型與自動駕駛

    自動駕駛在大規(guī)模駕駛數(shù)據(jù)上訓練,展現(xiàn)出很強的決策規(guī)劃能力,但是面對復雜罕見的駕駛場景,依然存在局限性,這是因為
    的頭像 發(fā)表于 11-07 15:15 ?335次閱讀
    連接視覺語言大模型與<b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>自動駕駛

    智己汽車“”智駕方案推出,老司機真的會被取代嗎?

    與Momenta聯(lián)合打造的IM AD 3.0端直覺智能駕駛系統(tǒng),在結構設計和決策邏輯上,進行了大膽的創(chuàng)新,試圖用“直覺化”思維模式替代傳統(tǒng)的模塊化系統(tǒng)。 ? IM AD 3.0的技術架構:
    的頭像 發(fā)表于 10-30 09:47 ?356次閱讀
    智己汽車“<b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>”智駕方案推出,老司機真的會被取代嗎?

    InfiniBand網(wǎng)絡解決LLM訓練瓶頸

    的,這需要大量的計算資源和高速數(shù)據(jù)傳輸網(wǎng)絡。InfiniBand(IB)網(wǎng)絡作為高性能計算和AI模型訓練的理想選擇,發(fā)揮著重要作用。在本文中,我們將深入探討大型語言模型(LLM)訓練的概念,并探索
    的頭像 發(fā)表于 10-23 11:26 ?553次閱讀
    <b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>InfiniBand網(wǎng)絡解決LLM訓練瓶頸

    測試用例怎么寫

    編寫測試用例是確保軟件系統(tǒng)從頭到尾能夠正常工作的關鍵步驟。以下是一個詳細的指南,介紹如何編寫
    的頭像 發(fā)表于 09-20 10:29 ?570次閱讀

    恩智浦完整的Matter解決方案

    恩智浦為打造Matter設備,提供了完整的解決方案,從連接和安全解決方案到處理器和軟件,應有盡有,為Matter標準的規(guī)?;逃锰峁┯辛χ?。
    的頭像 發(fā)表于 08-26 18:04 ?2650次閱讀
    恩智浦完整的Matter<b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>解決方案

    實現(xiàn)自動駕駛,唯有?

    ,去年行業(yè)主流方案還是輕高精地圖城區(qū)智駕,今年大家的目標都瞄到了(End-to-End, E2E)。
    的頭像 發(fā)表于 08-12 09:14 ?851次閱讀
    實現(xiàn)自動駕駛,唯有<b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>?

    周光:不是真“無圖”,談何

    “如果智能駕駛系統(tǒng)不能徹底擺脫高精度地圖,談何?!?? 6月1日,元戎啟行CEO周光在粵港澳大灣區(qū)車展暨2024(第二屆)未來汽車先行者大會上表示。 ? 這并非周光第一次強調(diào)“無圖”方案與
    發(fā)表于 06-03 11:06 ?3133次閱讀
    周光:不是真“無圖”,談何<b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>

    小鵬汽車發(fā)布國內(nèi)首個量產(chǎn)上車的大模型

    小鵬汽車近日宣布,國內(nèi)首個大模型量產(chǎn)上車,這一革命性的技術將大幅提升智能駕駛的能力。據(jù)小鵬汽車介紹,這一大模型將使智駕能力提升二倍,感知距離同樣翻倍,同時能夠識別超過50種目標
    的頭像 發(fā)表于 05-28 11:47 ?778次閱讀

    小鵬汽車發(fā)布大模型

    小鵬汽車近日宣布,其成功研發(fā)并發(fā)布了“國內(nèi)首個量產(chǎn)上車”的大模型,該模型可直接通過傳感器輸入內(nèi)容來控制車輛,標志著智能駕駛技術的新突破。
    的頭像 發(fā)表于 05-21 15:09 ?748次閱讀

    理想汽車自動駕駛模型實現(xiàn)

    理想汽車在感知、跟蹤、預測、決策和規(guī)劃等方面都進行了模型化,最終實現(xiàn)了的模型。這種模型不僅完全模型化,還能夠虛擬化,即在模擬環(huán)境中
    發(fā)表于 04-12 12:17 ?504次閱讀
    理想汽車自動駕駛<b class='flag-5'>端</b><b class='flag-5'>到</b><b class='flag-5'>端</b>模型實現(xiàn)

    百度開源DETRs在實時目標檢測中勝過YOLOs

    這篇論文介紹了一種名為RT-DETR的實時檢測Transformer,是第一個實時目標
    的頭像 發(fā)表于 03-06 09:24 ?1783次閱讀
    百度開源DETRs在實時<b class='flag-5'>目標</b><b class='flag-5'>檢測</b>中勝過YOLOs
    网上百家乐官网骗人| 中国百家乐官网技巧软件| 百家乐官网职业打| 百家乐娱乐礼金| 百家乐官网游戏规测| 做生意摆放风水| 新全讯网3| 百家乐官网出闲几率| 百家乐扫瞄光纤洗牌机扑克洗牌机扑克洗牌机 | 玩百家乐官网怎么才能赢| 百家乐游戏平台有哪些哪家的口碑最好| 六合彩开奖记录| 夜总会百家乐官网的玩法技巧和规则| 威尼斯人娱乐城最新地址| 百家乐官网真人百家乐官网皇冠开户| 百家乐平7s88| 浪卡子县| 温州百家乐真人网| 大发在线德州扑克| 百家乐官网计划工具| 亿酷棋牌世界下载手机版| 木星百家乐官网的玩法技巧和规则 | 八卦24方位| 大上海百家乐的玩法技巧和规则| 网站百家乐官网博彩| 百家乐八卦九| 百家乐官网路单资料| 连环百家乐怎么玩| 海立方百家乐官网海立方| 新利百家乐的玩法技巧和规则| 百家乐官网视频游戏网站| 试玩百家乐的玩法技巧和规则 | 蓝盾百家乐赌城| 百家乐官网视频游戏盗号| 广发百家乐的玩法技巧和规则| 百家乐官网投注技巧| 威尼斯人娱乐城怎么样lm0| 百家乐官网对子的玩法| 大发888官方正版网| 百家乐网址哪里有| 百家乐官网有几种打法|