GPT-6 Astra 與 Sol 差在哪?看懂 AI 在企業工作中的新進展

2026 年 9 月 3 日,OpenAI 發布 GPT-6 Astra。幾天後,黃仁勳在 X 貼文 中表示:「AGI 已到來。」這則發言引起一些好奇與討論:Astra 模型能做到哪些事?AI 達到什麼程度,才算通用人工智慧(AGI)?

對經常使用 AI 的企業工作者而言,Astra 與上一代 Sol 的差異提供了重新檢視過往 AI 應用的理由:操作太慢、簡報老是不合格式,或任務中途調整方向就遺忘原始限制的情況,Astra 都有了明顯的改善。

本篇 Aiworks 將先比較 Astra 與 Sol 的整體表現,再看電腦操作、文件製作、程式開發與視覺設計的具體優化,最後回到 AGI 的定義,討論這些進展意味著什麼。

GPT-6 Astra 與 Sol 相比,整體表現如何?

OpenAI 公布的評測 來看,Astra 在科學、數學、推理、程式、搜尋與長文理解上都有進步。其中,高難度數學與長文理解拉開了較大的差距

橘色為 Astra,藍色為 Sol。六項評測分別比較;綜合能力指數另列於下方。 (圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)
橘色為 Astra,藍色為 Sol。六項評測分別比較;綜合能力指數另列於下方。
(圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)

註:ARC-AGI-3 要求模型自行探索陌生的 2D 遊戲、推斷規則,分數比較完成任務時相對於人類的行動效率。Sol 僅 7.8% 是因為採原設定;Astra 99.9% 則採保留推理、啟用長紀錄壓縮的 Responses API。Sol 若改用後者設定,在另一組公開題目也有分數的提升,顯示此差距同時受模型與測試設定的影響。(官方說明)。

這些進展也反映在實際工作中,接下來的案例分享,會進一步呈現這些改變是如何影響工作過程與產出。

Astra 的能力更新,會改變哪些工作?

一份提案可能同時需要查資料、整理數據、製作簡報,再把概念做成可展示的畫面。Astra 這次的更新分別改善了這些環節。

Computer Use:介面定位更精準,也縮短操作時間

Computer Use 讓 AI 直接操作軟體。Astra 這次能更精準地定位介面上的操作目標,也能更快完成一連串操作。在 OSWorld 官方模擬結果中,Astra 的得分提高,耗時也接近減半。對原本因為等待太久而放棄交給 AI 的工作,這項差異尤其值得重新評估。Codex 同期也改善了電腦工具的執行速度。

OSWorld 2.0 官方延遲模擬,任務耗時為約數。 (圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)
OSWorld 2.0 官方延遲模擬,任務耗時為約數。
(圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)

當任務跨到其他企業軟體,AutomationBench 要求 AI 在模擬環境中執行業務、行銷或營運工作,並核對操作後的資料是否符合要求。這項評測由 Sol 的 18.1% 升到 Astra 的 41.4%,呈現了多步驟執行的改善。

在官方的網站功能檢查示範中,Astra 依清單測試導覽、搜尋與互動功能。以行銷團隊來說,可以嘗試把活動測試頁與清單交給 AI,請它逐項操作、記錄異常,再評估省下多少人工測試時間。

文件與簡報:選對內容、沿用風格,任務轉向時保留原要求

電腦操作改善的是執行過程,文件製作還要處理另一個問題:成品是否符合使用者要交付的內容與格式。Astra 這次加強的是依範本編排,以及用精簡且有結構的敘事方式呈現重點。OpenAI 將這些進展歸因於電腦操作能力的提升,以及針對專業工作環境的訓練。

Gaia 簡報展示的是根據少量範本,延伸出整份風格一致的內容。官方提供的 3 頁 OpenAI 參考範本包含封面、資訊架構,以及文字搭配圖表的版型。展示的成品是介紹虛構模型 GPT-Gaia 的 12 頁簡報,涵蓋模型架構、效能、天氣圖、運算時間與定價。

上排為範本;下排為 12 頁成品中的第 1、5、7 頁。GPT-Gaia 及數據為虛構示範。 (圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)
上排為範本;下排為 12 頁成品中的第 1、5、7 頁。GPT-Gaia 及數據為虛構示範。
(圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)

另一項改善是,Astra 在處理途中提問或新增要求後,延續原任務、保留既有條件的表現有所提升。官方指出,先前模型有時會把補充訊息當成新目標,因而遺失原本的任務或限制。

工作情境示意:追加新要求後,本季資料、公司版型與 10 頁限制仍然保留。 (圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)
工作情境示意:追加新要求後,本季資料、公司版型與 10 頁限制仍然保留。
(圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)

對經常做月報或客戶提案的人,可以拿一份過往資料作為範本去做新模型的測試:檢視 AI 產出的重點是否清楚、限制皆有遵守與否。也同時觀察原先的資料範圍、與品牌風格是否一致。當 AI 能寫好內容、沿用格式,就能省下調整版面與重新交代的時間,讓製作者把心力放在提案內容與判斷上。

程式開發:完成較複雜的任務,找回長時間開發的紀錄

程式開發機制上的新進展是 Codex 處理長對話的方式,模型每次能讀取的內容有容量上限。當工作紀錄累積一定程度時,過去模型會把它整理成摘要,再接續工作;反覆濃縮的過程,可能省略某次修正失敗的原因。

Astra 的實驗性功能讓模型持續累積工作筆記,需要細節時再搜尋原始紀錄。即使換到下一個視窗,先前的筆記仍會保留。若遺漏某項需求或測試結果,模型還能搜尋先前的訊息與工具輸出,在筆記中補回接下來工作需要的資訊。

筆記保留累積的工作細節,需要時再搜尋先前的需求與測試結果。 (圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)
筆記保留累積的工作細節,需要時再搜尋先前的需求與測試結果。
(圖片來源:使用 OpenAI ImageGen 生成,Aiworks 製作)

視覺與 3D 設計:改善畫面判斷,把模型做成可探索的空間

OpenAI 表示 Astra 加強了網站、遊戲、應用與渲染成果的視覺判斷。Simon Willison 的程式繪圖實測 提供了一個直觀的比較:請模型用 SVG 向量繪圖程式碼畫出「鵜鶘騎腳踏車」。下圖比較兩者在 max 推理強度下的作品:Sol 的鳥身較圓、輪廓較簡單;Astra 則畫出較修長的身形、羽毛層次與彎曲的踩踏姿勢。

Astra · max

兩張皆為 max 推理強度的原作;其他思考程度見 原作者完整比較。 (圖片來源:Simon Willison 的鵜鶘繪圖實測,Simon Willison)

Sol · max

兩張皆為 max 推理強度的原作;其他思考程度見 原作者完整比較。 (圖片來源:Simon Willison 的鵜鶘繪圖實測,Simon Willison)

兩張皆為 max 推理強度的原作;其他思考程度見 原作者完整比較
(圖片來源:Simon Willison 的鵜鶘繪圖實測,Simon Willison)

官方展示的 Tidal Rush 賽車遊戲,則能直接看到程式與視覺製作結合的成果:有完整賽道、車輛、操作介面與可互動玩法。可以直接體驗 Tidal Rush 賽車遊戲,觀察場景、車輛動作與操作介面如何配合。

點擊圖片可開啟遊戲,實際體驗賽道、車輛與操作介面。 (圖片來源:Pietro Schirano/OpenAI 官方展示)
點擊圖片可開啟遊戲,實際體驗賽道、車輛與操作介面。
(圖片來源:Pietro Schirano/OpenAI 官方展示)

官方住宅案例把這些能力放進一段完整製作流程:Astra 在 Blender 製作房屋模型,再轉成 Unreal Engine 5 中可以走動的場景。

Solace Garden House 的三個視角;點圖可查看完整七個視角。 (圖片來源:GPT-6 Astra 官方展示,OpenAI)
Solace Garden House 的三個視角;點圖可查看完整七個視角。
(圖片來源:GPT-6 Astra 官方展示,OpenAI)

這類作品能讓空間提案的討論更具體。當客戶說「希望客廳更開闊」,團隊便有一個共同畫面,可以討論視線、家具位置,以及室內與庭院的連接。團隊也因此能更早確認彼此的想像是否一致,再把修改時間用在空間配置與設計細節上。

Aiworks 觀點:距離 AGI 更近,企業現在可以做什麼

Aiworks 認為,Astra 讓 AI 更接近通用工作的要求。幾種能力開始能共同支撐較完整的製作過程:理解需求、操作不同軟體、延續修改,再交出文件、程式或立體場景。Computer Use 與 3D 的改善,也讓 AI 能參與更多原本需要人反覆操作與調整的工作。

至於是否已經達到 AGI,仍取決於採用的定義。OpenAI Charter 強調高度自主,並在大多數具經濟價值的工作上超越人類;Google DeepMind 的分級框架 則區分能力的深度與廣度,並討論自主性。依這些要求來看,Astra 展示的能力提供了更接近 AGI 的具體理由,但接下來還是要持續觀察它在更多真實任務中,到底能達到什麼表現,以及需要多少人為的協助。

對企業而言,這次 Astra 的更新值得拿過去的工作重新測試與評估。先前因為操作太慢、任務追加後遺失原有條件,或 3D 成果難以使用而擱置的任務,都可以沿用當時的材料與交付標準再試一次。後續團隊便能依據實際表現,重新安排或是擴大 AI 可以承擔的工作範疇。


📩 想為你的組織打造 AI 協作能力?

Aiworks 提供企業內訓、客製化培訓與實作工作坊,協助各產業團隊規劃生成式 AI 的導入與應用策略。

▼ 聯絡我們|規劃你的 AI 實戰課程,讓轉型真正落地 ▼

(若表單未正常顯示,請點擊此連結進入表單填寫頁面)


推薦延伸閱讀

從 ChatGPT Work 看企業 AI 導入:任務交接、人工核准與治理邊界

ChatGPT Sites 怎麼用?一次看懂功能、分享設定與部署方式

Google Gemini 新功能一次看:模型、語音、Notebook 與 Skills 有哪些改變?

參考來源