<code id="oewc0"></code>
<optgroup id="oewc0"><div id="oewc0"></div></optgroup>
<optgroup id="oewc0"><div id="oewc0"></div></optgroup>
<center id="oewc0"><wbr id="oewc0"></wbr></center>
<optgroup id="oewc0"><wbr id="oewc0"></wbr></optgroup>

CSIG主辦|15萬獎金池,第二屆Agent Memory Challenge即將啟動

發布時間:2026-08-23      截稿時間:2026-09-20      閱讀量:111次     
  第二屆Agent Memory Challenge(Agent記憶公開挑戰賽)即將啟動。本屆挑戰賽由中國圖像圖形學會(CSIG)主辦,南京大學、浙江大學、Datawhale、CSIG企業聯絡與標準化工作委員會承辦,并依托Agent Memory Leaderboard(AML)統一評測平臺,完成報名、評測、結果復核和榜單發布。
  隨著大模型智能體從單輪交互走向長期協作,長期記憶已成為提升Agent連續性、穩定性和個性化能力的重要基礎。當前不同記憶系統常使用不同的數據集、回答模型和評測流程,公開成績難以直接橫向比較。AML挑戰賽旨在基于統一的Add/Search接口協議、固定的評測協議和可復核的運行流程,推動建設更加開放、公平、可復現的Agent Memory Benchmark,為研究者和開發者提供可比較的評測環境,促進長期記憶技術的研究交流、工程驗證與產業應用。
  2026年8月12日,首期AML挑戰賽正式揭榜。榜單發布后,AML持續受到研究者、開源社區和產業團隊關注,也收到了許多肯定與建設性建議。
  截至本文發布,AML官網累計點擊量已超過30萬;AML官方主頁自上線以來持續位列Hugging Face Spaces Trending熱門榜單前十,近期更連續多日位居趨勢榜第一。對一個面向前沿研究與工程實踐的評測項目而言,這些數據不僅體現了首期賽事的傳播熱度,也說明Agent Memory統一評測正獲得越來越多的社區關注,公開、可比的評測結果也受到廣泛期待。
  感謝所有提交系統、參與討論、分享經驗和提出建議的研究者與開發者。
  組織機構與賽事安排
  主辦單位:中國圖像圖形學會(CSIG)
  承辦單位:南京大學、浙江大學、Datawhale、CSIG企業聯絡與標準化工作委員會
  統一評測平臺:Agent Memory Leaderboard(AML)
  AML指導委員會:由來自近30所高校及研究機構的科研團隊代表組成,就AML長期評測方向、評測方法和榜單治理提供指導與審議意見。
  2026年9月20日00:00起,參賽者可進入官網Evaluation頁面提交報名信息并申請評測Key。
  比賽期間,平臺將按提交順序滾動開展接入與評測。
  本次比賽不收報名費。
  賽道與參賽組別
  本屆賽事面向全球高校、科研院所、開源社區、獨立研究團隊及個人開放,支持個人參賽、團隊參賽及跨單位自由組隊。賽事設置文本、代碼和多模態三個賽道,分別評測并排名:
  文本賽道:考查長期多輪對話中的事實精準召回、多跳邏輯關聯、時間序列推理、用戶畫像個性化對齊和記憶安全邊界。
  代碼賽道:面向軟件工程場景,考查系統從歷史任務中找回調試過程、開發經驗和項目上下文,并支持后續開發與排障。
  多模態賽道:考查系統對圖像、音頻、視頻和文本信息的記憶、跨模態關聯、線索檢索和上下文銜接能力。
  每個賽道內設置開源方法榜和商業產品榜:
  開源方法榜:需提供可公開核驗的GitHub倉庫,并固定commit(提交)或版本號,說明方法來源、作者及方法實現細節。
  商業產品榜:無需公開內部實現,但需提供固定產品版本和穩定可用的Add/Search API。
  同一參賽者可同時參加多個賽道,但只能選擇一種參賽組別。
  統一評測與提交流程
  Add:接收評測記憶,完成存儲、組織、索引和更新。
  Search:根據問題返回相關記憶或證據,不負責生成最終答案。
  平臺統一完成任務編排、Answer(回答生成)、Eval(自動評測)、結果復核和榜單發布。公開Smoke測試用于檢查接口結構、鑒權和端到端鏈路;Full評測用于正式計分。私有題目、答案和其他受保護材料不向參賽者開放。
  【提交流程】:
  閱讀參賽說明和API接入指南,選擇賽道與參賽組別。
  固定參賽版本,準備系統說明、運行環境及接口材料。
  在Evaluation頁面提交報名信息并申請評測Key。
  配置Add/Search接口,完成Smoke測試。
  確認接口穩定且返回結構符合協議后,發起Full正式評測。
  在Evaluation頁面查看私有結果。
  平臺完成材料、版本、結果和合規復核后,符合條件的成績進入公開榜單。
  Full任務受理后,參賽版本將被凍結。代碼、鏡像、API、鑒權信息和容量設置須與申報內容保持一致。
  按本期安排,每位參賽者在完整賽事周期內最多發起2次Full評測;任務成功或部分完成后,參賽者將在該賽道進入30天冷卻期。失敗或取消的任務,按頁面提示及當期配額處理。最終榜單成績以最新一次有效Full評測結果為準。
  【接口運行、結果復核與合規要求】:
  參賽方在Evaluation頁面發起Full評測后,平臺會在48小時內完成資源調度并啟動評測。其中,48小時僅指資源調度并啟動評測的時限,不代表任務將在48小時內完成。從資源調度開始,直至任務處理完成并結束必要的后續復核,參賽方應保持接口公網可訪問,并保持API契約、鑒權方式和容量設置穩定(整體運行時間通常約為2–10天,具體取決于方法實現復雜度和評測規模)。
  Full任務完成且平臺未提出進一步復核要求后,參賽方原則上可停止記憶管理服務。若平臺在結果、版本或合規復核中發現需要進一步核驗的問題,將通過登記郵箱通知參賽方。請及時關注郵件和Evaluation頁面狀態,并按通知要求恢復接口服務,補充運行日志、版本材料或其他復核材料。
  評測過程中,每個user_id、任務和樣本必須獨立處理,評測記憶不得跨用戶、跨任務、跨團隊或跨運行共享。嚴禁硬編碼、基準泄漏、提示詞注入、人工實時答題、結果操縱、惡意刷榜和未披露的代碼復用。
  評測數據及其派生副本僅用于本次評測任務,不得用于訓練、微調、產品分析、數據集重建或對外傳播。
  獎金、Benchmark Contribution
  與報名入口
  三個賽道合計獎金150,000元,獎金僅面向開源方法榜設置。
  AML將持續征集Benchmark Contribution(基準貢獻)。歡迎高校、科研機構、開源團隊、產品團隊和社區成員提交來源明確、難度適當、具有補充價值且可復核的Benchmark、測試場景、數據或評測維度建議,以及公開評測契約改進方案。提交內容不得包含私有評測軌跡、參賽者數據、訪問憑據或商業系統內部信息;請保留上游作者署名和許可證信息。歡迎通過AML官網「基準貢獻」模塊或下方咨詢郵箱聯系我們。
  報名與評測Key申請:
  https://agentmemoryleaderboard.ai/evaluation
  參賽說明:
  https://agentmemoryleaderboard.ai/rules
  API接入指南:
  https://agentmemoryleaderboard.ai/api-guide
  賽事倉庫:
  https://github.com/AML-memory/agent-memory-leaderboard
  咨詢郵箱:
  contactus agentmemoryleaderboard.ai
  請關注AML官網及官方公眾號「記憶之巔排行榜」后續公告,及時獲取報名入口、接口協議、評測安排和成績發布信息。
  歡迎符合條件的高校、科研機構、企業、開源團隊和個人研究者報名參賽,共同推動Agent Memory Benchmark的建設與演進。

  本文賽事信息依據本期賽事方案整理。具體主辦承辦信息、參賽資格、接口規范、評測配置、復核流程、獎金發放及賽程調整,以主辦方正式公告和官網最新規則為準。

  https://mp.weixin.qq.com/s/SS4itah0sa4R2vcDQ4uevQ

<code id="oewc0"></code>
<optgroup id="oewc0"><div id="oewc0"></div></optgroup>
<optgroup id="oewc0"><div id="oewc0"></div></optgroup>
<center id="oewc0"><wbr id="oewc0"></wbr></center>
<optgroup id="oewc0"><wbr id="oewc0"></wbr></optgroup>
日日做夜狠狠爱欧美黑人