<th id="b9n9v"><noframes id="b9n9v"><span id="b9n9v"></span>
<span id="b9n9v"><noframes id="b9n9v">
<th id="b9n9v"><noframes id="b9n9v">
<span id="b9n9v"><video id="b9n9v"></video></span>
<th id="b9n9v"></th>
<span id="b9n9v"><noframes id="b9n9v">
<th id="b9n9v"><video id="b9n9v"></video></th>
<progress id="b9n9v"><noframes id="b9n9v"><strike id="b9n9v"><noframes id="b9n9v"><strike id="b9n9v"></strike>
<span id="b9n9v"></span>
<th id="b9n9v"><noframes id="b9n9v">
<th id="b9n9v"></th>
<span id="b9n9v"><noframes id="b9n9v"><span id="b9n9v"></span>
<th id="b9n9v"><noframes id="b9n9v"><span id="b9n9v"></span>
<th id="b9n9v"></th>
<th id="b9n9v"><noframes id="b9n9v">
<th id="b9n9v"></th>
<th id="b9n9v"></th><th id="b9n9v"></th><strike id="b9n9v"></strike>
<strike id="b9n9v"></strike>

免費咨詢熱線

0731-84988138

DeepSeek Harness開啟內測?看來V4正式版也不遠了

來源于:開云手機網頁登錄入口

發布時間:2026-07-30 05:05:00

文章摘要:

開云手機網頁登錄入口:DeepSeek Harness開啟內測?看來V4正式版也不遠了-開云手機網頁登錄入口

DeepSeek Harness開啟內測?看來V4正式版也不遠了-開云手機網頁登錄入口

   



從2026年3月崔添翼加入DeepSeek開始組建Harness團隊到今天,憋了5個月,式版DeepSeek的也不遠開云kaiyun官方入口Harness工具這回真的要來了?

一張截圖在各大AI社區流傳,內容是啟內DeepSeek Harness的內部測試招募通知。



按照截圖的說法,Harness計劃于本周晚些時候開啟內測,也不遠首批用戶從小范圍群組中篩選,啟內入選者需要提交個人資料、式版簽署《保密承諾函》,也不遠才能拿到產品訪問權限。啟內

并且截圖顯示,式版一旦泄密,也不遠不只是啟內當次資格取消,還會影響日后DeepSeek各類模型、式版產品內測以及合作機會的也不遠入選。

雖然截圖真偽無法驗證,但結合DeepSeek此前關于V4正式版發布日期的公告,以及崔添翼曾表示Harness將和V4同時發布,那么這條傳聞很有可能是真的。

然而目前市面上沒有任何關于DeepSeek Harness產品形態的報道,按照DeepSeek以往的作風來看,Harness是重要產品,它的研發與設計一定是嚴格保密的。

不過我們還是能通過DeepSeek的各種蛛絲馬跡,大致推斷出這個產品大概長什么樣。

01

DeepSeek Harness到底長什么樣

DeepSeek Harness究竟長什么樣?目前公開的信息只有兩塊,第一塊是負責人崔添翼的量化背景,第二塊是DeepSeek關于Harness部分的招聘職位描述(JD)。

先來說第一塊,崔添翼不是做AI出身的。他在Jane Street做了九年的量化交易系統。

在量化交易系統里,最值錢的是執行系統。它講究的開云kaiyun官方入口是軟件能不能在毫秒級別把策略變成交易?能不能在出了異常的時候自動恢復?能不能在每一步都留下可追溯的日志?

如果把這個思維搬到Harness上,那么其大體邏輯可能會是這樣的:

量化交易里,慢一毫秒,錢就被別人賺走了。所以系統的每一步都得摳著毫秒級優化,不能有多余的步驟。

所以Agent循環的每一輪推理-執行-反饋都要快,不能有冗余開銷。你跟AI說一句話,它不能半天沒反應。從它想一下、到調用工具、到拿到結果、到再想下一步,整個循環必須得快。

同時,量化系統必須得非常可靠。如果量化系統崩了,那虧的是真金白銀。所以哪怕行情再詭異、數據再離譜,系統本身不能掛,得能自己恢復。



模型可能會犯錯,甚至輸出一些離譜的東西給你,但Harness這個框架本身不能崩,得能兜住結果,想辦法把模型拉回來繼續干活。

其實在量化交易里,網絡斷了、交易所接口掛了、行情數據異常了,這些都是家常便飯。系統不能一遇到問題就死,得有重試、有備用方案、實在不行就降級,比如實時行情拿不到,就先用延遲數據頂著。

模型也是同理,調用工具失敗了、文件讀不出來、網絡超時了,這些都是常事。好的Harness不會因為一個工具調用失敗就整個任務廢掉,它會自動重試、換個方法、實在不行就降級處理,繼續推進任務。

另外,由于量化系統涉及大量的金錢,交易出問題了,得能查到是哪一步出錯的,可能是下單的時候錯了,也有可能是行情解析錯了。每一步都得有日志,這樣才能復盤。

Harness也一樣,AI把活干砸了,你得能回看它是怎么一步步走到坑里的。是哪一步想錯了?哪個工具調用返回了異常結果?它為什么做了那個錯誤的決定?

在整個量化系統里,訂單狀態也非常重要。不能出現“我以為下單了但其實沒下”或者“重復下單”這種情況,每一步的狀態都得是確定的、一致的。

放到Harness上,在所有人都押注長程任務、復雜任務的當下,能否維持模型中間的狀態,將決定整個Harness的成功率。不能前面改了A文件,后面改B文件的時候把A的改動忘了。

最后是風控和安全了,量化交易有熔斷機制,行情異常的時候自動停止交易,防止一個bug把錢虧光。另外,高風險的操作必須有審批,不能說下單就下單。

那么回到Harness里,在讓AI刪文件、格式化硬盤、跑sudo rm -rf這種高危操作之前,就必須得停下來進行確認。不能它自己想干啥就干啥,Harness得有個安全閘門。

02

從DeepSeek的JD里看產品

說完了第一塊再說第二塊,DeepSeek官方掛出來的崗位JD。

JD里提到了KV Cache、長上下文裁剪與壓縮算法,說明Harness會做智能的上下文管理。

配合DeepSeek V4的前綴緩存能力,相同上下文的任務不重復計算。長對話中自動對歷史消息做摘要,保留關鍵信息,釋放token空間。根據任務復雜度動態調整上下文策略,簡單任務用短上下文省成本,復雜任務拉滿百萬token的長上下文。



相當于是把每一份算力都花在刀刃上,小事能省則省,大事算力拉滿。

JD里還提到了向量存儲方案選型、會話狀態持久化與回放,這也就意味著Harness有長期記憶系統,會記住你項目的架構、編碼規范、常用模式,下次打開項目自動加載。

會話持久化代表就算你關掉終端后再打開,之前的對話狀態、修改記錄、執行軌跡依然都在。甚至DeepSeek Harness還可能記住你的命名風格、喜歡的框架版本,跨對話記憶你的各種習慣。

JD里提到了Tool Use鏈式調用、錯誤回退與自動重試,這是指Harness有完整的工具調用編排能力,能編排多步工具調用的有向無環圖。工具調用失敗自動重試,重試不行就降級換方案,再不行就回滾到上一個穩定狀態。

劃重點,DeepSeek Harness還可能支持動態注冊新工具,Agent能自動發現并學會使用。

JD里提到了多Agent間通信協議設計、任務分解與結果聚合。這說明Harness有子Agent架構,一個主Agent負責任務規劃和協調,多個子Agent負責具體執行。

不同子Agent有不同的系統提示詞、工具權限、上下文窗口。主Agent把復雜任務拆成子任務,分發給子Agent,再把結果聚合成最終輸出。每個子Agent運行在獨立上下文或進程中,互不干擾,出錯了不影響主流程。

JD里還提到了任務規劃圖生成、執行路徑在線優化。這意味著Harness有規劃與自進化的能力。

規劃說的是接到任務后先生成執行計劃,分幾步、每步用什么工具、預期產出是什么。執行過程中根據實際情況動態調整,不是死板地按原計劃走。每完成一步就自我檢查,不對就自動修正。

而且,DeepSeek Harness很可能有一套內部benchmark,每次架構改動都跑一遍,看是進步了還是退步了,以此實現工具的自我進化。

最有意思的一點在JD最后,DeepSeek說,要讓模型與Harness共同進化,實現模型與Harness的深度適配。

這也就代表了,Harness會利用DeepSeek-V4模型的特性,比如V4的稀疏注意力、前綴緩存。它不是通用Harness 框架,而是跟DeepSeek模型深度綁定的一體化產品。

其實這也是OpenAI現在的理念。

此前。OpenAI是有兩條獨立的后訓練線。一條是代碼專用的Codex線,一條是通用推理的GPT線。到GPT-5.5的時候,兩條線合并了,GPT-5.5-Codex將代碼能力和通用推理能力整合進了同一個模型。

這就好比汽車,原廠就像汽車廠家自己做發動機+變速箱,知道發動機的扭矩曲線、轉速特性,變速箱換擋邏輯可以精準匹配。但是如果把這事交給第三方來做,發動機對他們來說是黑盒,只能憑感覺調變速箱,這就導致永遠調不到原廠那么絲滑。

03

V4正式版,跳票一個月

Harness不是一個人來的。崔添翼曾表示,V4正式版和Harness將同步發布。

4月24日,DeepSeek發布V4 Preview,Pro和Flash兩個版本同步開源。兩個月后,在6月29日那天,DeepSeek向API用戶發送郵件,明確說V4正式版計劃于7月中旬上線。結果眼瞅著要到8月了,依然沒有任何關于V4正式版的消息。

曾有傳聞稱,由于7月24日,DeepSeek舊的API deepseek-chat和deepseek-reasoner正式退役,所以V4正式版將會同期發布。畢竟更換API接口,通常是給新版本讓路的前置動作。

可V4正式版依然沒有發布。只是兩個舊模型名正式停用,所有調用必須換成新的deepseek-v4-flash和deepseek-v4-pro。換句話說,API接口名換了,但模型本身還是預覽版那套。

那么正式版比預覽版強在哪?

綜合多個內測信源的說法,稱V4正式版在三個方向上做了升級:

核心推理能力再上一個臺階。

日常對話的響應速度明顯優化。

Agent能力針對性迭代。

有參與灰度測試的人總結,V4正式版整體表現接近Opus 4.8級別,編碼能力不弱于GPT-5.6 Sol,Agent能力和3D、SVG生成能力大幅提升。同樣的任務比Claude Fable 5迭代輪數還少。



不過這些說法都來自非官方渠道,DeepSeek沒有公開確認。

預覽版的問題其實社區里討論得不少。V4 Preview在編程能力上和Kimi K2.7、GLM 5.1接近,但仍然遜色當前的主流模型。

尤其是在那些復雜的任務上。有測試者發現,即便要求模型“不使用外部依賴”,模型依然引用了外部CDN。

遇到真正復雜的任務,需要手動加reasoning_effort=max(推理強度最高)才能拿到更深的思考深度,但變成agent往往會忽略這個提示詞,導致模型思考的強度不夠。

還有一點,雖然目前DeepSeek已上線識圖模式(OCR),不過DeepSeek-V4的多模態能力也是短板。

按照DeepSeek官方的說法,預覽版是純文本,正式版首次原生支持圖像推理,DeepThink引擎可以在同一個思考流程中分析圖片、解讀截圖。這變相也增加了Harness工具的壓力。

以及V4正式版會加入一些企業功能,但具體如何,DeepSeek官方并沒有進一步透露。

再說價格,這是爭議最大的部分。

V4正式版將引入峰谷定價機制,高峰時段(北京時間9:00-12:00和14:00-18:00)API價格直接翻倍。具體來看,V4 Pro緩存命中輸入平時0.025元/百萬 token,高峰0.05元;緩存未命中平時3元,高峰6元;輸出平時6元,高峰12元。V4 Flash 緩存命中平時0.02元,高峰0.04元;緩存未命中平時1元,高峰2元;輸出平時2元,高峰4元。

峰谷定價這件事,往好了說是把算力選擇權還給用戶,不急的任務挪到低谷時段跑,成本更低。可另一方面,在平時的辦公時間,跑相同的任務,成本就會增加。

這不是DeepSeek第一次在定價上換思路。

2025年2月搞過夜間錯峰優惠,V3五折、R1二五折。2025年9月 V3.1發布,取消夜間優惠,全天統一價,輸出價格還往上抬了50%。

但關鍵問題不在于價格漲沒漲,而在于結合Harness之后,整體使用成本會如何?

第三方測試顯示,不同的harness 在完成同樣任務時,token消耗差異巨大。測試機構用DeepSeek V4 Flash,分別測試了Claude Code、OpenCode和Pi這三個市面上最常見的Harness工具。發現,三種工具的代碼質量基本一致,但Claude Code 每個任務平均跑約70次工具調用,OpenCode只有約22次。

此外,同一個任務,在弱Harness(Pi)里失敗了,換到強Harness(Claude Code)里居然成功了。

因此,如何去平衡價格與性能,這是DeepSeek做Harness必須要面對的問題。

不過有一點我很放心,在省錢這件事上,梁文鋒還是太權威了。

分享到:
返回首頁返回首頁
上一篇:第三代中繼衛星升空!天鏈三號01星成功發射 下一篇:新規生效!哈蘭德犯規發生在角球開出之前,因此挪威被判重開角球
<th id="b9n9v"><noframes id="b9n9v"><span id="b9n9v"></span>
<span id="b9n9v"><noframes id="b9n9v">
<th id="b9n9v"><noframes id="b9n9v">
<span id="b9n9v"><video id="b9n9v"></video></span>
<th id="b9n9v"></th>
<span id="b9n9v"><noframes id="b9n9v">
<th id="b9n9v"><video id="b9n9v"></video></th>
<progress id="b9n9v"><noframes id="b9n9v"><strike id="b9n9v"><noframes id="b9n9v"><strike id="b9n9v"></strike>
<span id="b9n9v"></span>
<th id="b9n9v"><noframes id="b9n9v">
<th id="b9n9v"></th>
<span id="b9n9v"><noframes id="b9n9v"><span id="b9n9v"></span>
<th id="b9n9v"><noframes id="b9n9v"><span id="b9n9v"></span>
<th id="b9n9v"></th>
<th id="b9n9v"><noframes id="b9n9v">
<th id="b9n9v"></th>
<th id="b9n9v"></th><th id="b9n9v"></th><strike id="b9n9v"></strike>
<strike id="b9n9v"></strike>
调性视频