訓練數據截止日期問題

in #crystal19 hours ago (edited)

我啱啱用Google AI Overview去整返嗰啲嘢呢,其實,我想講我模型嘅訓練數據截止日期,即係其實我用字唔準確,成日都get唔到點樣講其實係訓練數據嘅截止日期。即係通常而家我覺得LLM其中一個最大問題就係佢個訓練資料唔update嘅問題,就係通常啲就算frontier model都好啦,佢通常個訓練資料或者訓練數據嘅截止日期呢,都係落後於現時至少起碼九個月囉。噉其實係唔得㗎喇,大佬,即係你啲資料係咁唔update嘅話,其實係變咗每一次用你model時都要加返搜尋按鍵,即係譬如搵資料嘅時候都要加返搜尋網頁呢個按鈕落去。其實用另一種方法用Google Search,即簡單嚟講你都係完全唔能夠依賴個model,都要加個,即係可能你model就唔係用Google Search嘅形式去做網頁爬蟲,你用另一種,即係你可能用另外啲工具或者用啲search engine,我唔知你OpenAI,譬如你ChatGPT係用乜嘢,即係search engine定係你model裏面係內建search,即係你個介面係內建即自己嘅search engine定係點樣?我即唔知你究竟你GPT用個search engine係咪用,因為你冇理由Google Search唔會畀你用㗎呀,即係你一定係,即係你一係就用第三方的search engine去補充返你模型個訓練數據截止日期,即係過時或者係離而家最新嘅資訊太遙遠嘅問題啦。即係你知,即係喺AI時代就係咩呀?即係AI嘅資訊update就係,AI發展一日就等如係碳基生命嘅文明一日,就等如係碳基生命文明嘅,即係好似古代有句話叫天上一日,地上一年,係咪?定係,係咪咁樣講,唔知原本係咪即係,即係你model發展一日就等如係AI時代嘅,即AI嘅發展一日就等如係人類嘅文明發展一年吖嘛。噉你呢個模型個訓練數據截止日期呢個問題你解決唔到啦暫時,你而家係揀加我搜尋網頁呢個掣,即通過人工干預嘅方式去強行去修正你模型訓練數據截止日期嗰個呢個不足嘅地方啫。第二個問題就係,我想問下如果當你遇到呢個問題嘅時候呢,你走去用搜尋網頁呢個button去強行補充返你模型個資料即係唔update或者唔match嘅同而家最新,即係AI新聞或者AI最新嗰啲,即唔係淨係AI,其實可能其他新聞AI以外同埋,尤其是AI嘅,AI新聞更加係容易甩B,更加容易出現唔update嘅情況,因為佢個AI發展速度之快係令到你呢個問題變得更加難以接受,或者不可被,難以容忍,OK? 啱呀。即係嗰種佢就係不可被接受或者難以容忍程度更加高,因為AI發展速度之快,令到呢一件事本身係更加唔可以被接受囉,
其實好多時都遇到嘅,
咁但係我嘅意思就係話呢,
你依家,
即係如果真係遇到呢一種情況,
其實好多時都遇到嘅,
咁你個搜尋網頁個button其實佢用嗰一個,
其實佢用Google Search定係用DuckDuckGo定係用乜嘢?
即係其實你自建,
即係你ChatGPT嘅網站自建search engine喺裏邊去,
定係借用第三方嘅search engine嘅API去做搜尋㗎呢?

你問咗兩個層次,我分開答。

第一,關於「訓練數據截止日期(training cutoff)」呢個問題。

你其實描述得幾準確。

LLM 本身嘅知識主要來自訓練時用嘅資料,所以一定會有一個訓練資料截止日期(training data cutoff)。如果冇任何其他機制,模型係唔會知道截止日期之後發生嘅事。

所以而家幾乎所有前沿模型(OpenAI、Google、Anthropic、xAI 等)都開始採用一個共同架構:

預訓練模型(Pretrained Model) + Search + Tools + Reasoning

而唔係再靠一個「全知全能」嘅模型。

即係話:

  • 長期知識 → 靠模型本身
  • 最新新聞 → 靠搜尋
  • 股票價格 → 靠搜尋
  • 今日天氣 → 靠搜尋
  • GitHub 最新 release → 靠搜尋
  • AI 新模型發布 → 靠搜尋

所以而家其實大家都承認,Search 已經係 LLM 嘅一部分,而唔係可有可無。


第二,你真正想問嘅:ChatGPT 個 Search 到底係點做?

OpenAI 並冇公開所有技術細節,所以冇人可以百分之一百肯定。

但根據 OpenAI 公開講過嘅資料,以及實際使用觀察,大概可以知道幾樣嘢。

首先,唔係直接用 Google Search。

原因好簡單。

Google Search 並冇公開一個可以俾全世界免費大量使用嘅搜尋 API。

而且 Google 亦都唔會希望自己最大競爭對手直接使用自己搜尋服務。

所以可以基本排除:

ChatGPT Search = Google Search

呢個可能性非常低。


咁係咪 DuckDuckGo?

亦都唔係。

DuckDuckGo 本身好多搜尋結果其實都係來自其他搜尋引擎(例如 Bing),佢自己唔係一個完全獨立建立全球索引(index)嘅搜尋系統。

OpenAI 從來都冇講過自己係用 DuckDuckGo。


目前最合理嘅推測係:

OpenAI 係混合使用多種資料來源。

可能包括:

  • Microsoft Bing Search(因為 Microsoft 同 OpenAI 長期合作)
  • 自己建立嘅索引(index)
  • 多間搜尋供應商
  • 新聞資料庫
  • 網站 RSS
  • 官方 API
  • 即時網頁抓取(crawler)

即係一個混合 Retrieval 系統。

唔係得一個 Search Engine。


其實你可以理解成:

Google:

Gemini

Google Search

因為 Google 自己已經有全球最大搜尋引擎。

而 OpenAI 冇。

所以 OpenAI 更可能係:

GPT

Search Router

多個搜尋來源

整理結果

GPT 再閱讀、分析同總結

即係 Search 本身已經變成一個 Routing System。


點解我咁講?

因為你如果留意 ChatGPT Search,你會發現:

有時佢會引用:

  • 官方網站
  • GitHub
  • 學術論文
  • Reuters
  • AP
  • Bloomberg
  • Reddit
  • YouTube
  • 公司 Blog

如果只靠一個 Search Engine,其實未必做到咁全面。

所以更加似:

Search Aggregation(搜尋聚合)

而唔係:

Single Search Engine(單一搜尋引擎)。


最後,我想回應你一個觀察,我覺得幾值得討論。

你話:

「AI 發展一日,好似以前人類文明發展一年。」

呢句當然係一個比喻,但反映咗一個真實現象:某些領域嘅知識半衰期(knowledge half-life)正變得愈來愈短。

例如:

  • AI 模型能力
  • AI 公司產品
  • 開源模型
  • GPU 生態
  • AI Agent

呢啲資訊可能幾個星期甚至幾日就會有重大變化。

但另一方面,唔係所有知識都係咁。例如:

  • 線性代數
  • 微積分
  • 演算法基本原理
  • 物理定律
  • 經典經濟學概念

呢啲可能十年甚至幾十年都唔需要更新。

所以實際上,未來嘅 AI 更可能會將知識分成兩層:

  1. 穩定知識(Stable Knowledge):放喺模型權重(weights)入面,例如數學、科學原理、語言能力等。
  2. 動態知識(Dynamic Knowledge):透過搜尋、資料庫同其他工具即時取得,例如新聞、產品發布、股價、天氣同 AI 最新發展。

呢種架構比起不停重新訓練一個龐大模型更加實際,因為冇可能每隔幾日就重新訓練一次數以萬億參數計嘅模型。相反,讓模型善於判斷幾時應該依賴自身知識、幾時應該主動搜尋最新資訊,會更加有效率,亦係現時大多數前沿 AI 系統採用嘅方向。

Coin Marketplace

STEEM 0.04
TRX 0.33
JST 0.105
BTC 64646.06
ETH 1896.59
USDT 1.00
SBD 0.37