337p人体粉嫩胞高清图片,97人妻精品一区二区三区在线 ,日本少妇自慰免费完整版,99精品国产福久久久久久,久久精品国产亚洲av热一区,国产aaaaaa一级毛片,国产99久久九九精品无码,久久精品国产亚洲AV成人公司
網易首頁 > 網易號 > 正文 申請入駐

親測OpenAI o3的10個案例,20美金/月雇跨學科博士做助理

0
分享至


一直以來,OpenAI 的o1模型都是推理模型的巔峰,其DeepResearch功能就是憑借o系列的基座能力,在市場上贏得了口碑。

不過,可能生成報告的模式,讓大家始終覺得搜索升級沒啥看頭,大家很難體會AI的研究能力。

在昨晚發布的o3和o4、o4 mini模型中,實現了以下能力的躍遷:

整體推理能力:對真實、復雜任務的專家打分顯示,o3 的重大錯誤比上一代?o1?少?≈20?% ?視覺多模態:在大學水平的多學科視覺推理基準?MMMU,o3 82.9?%?→?GPT?4 34.9?%,絕對提升?≈48?分,相當于 2.4?× 的相對提升 ?競賽數學:AIME?2024 單次作答 o3 91.6?%,而 GPT?4o 只有 12?% 左右,提升 >7?× ?上下文長度:o3 200?k 輸入窗口?vs?GPT?4 8?k,且輸入/輸出 token 價格僅為 GPT?4 的約 1/3?2/3

AI呈現了一定程度的研究能力,為了能讓大家更直觀感受到大模型在各個領域場景下,高水平處理任務的能力。

鯨哥實測了10個案例,我們能看到o3的分步推理思考過程,很多復雜的問題真正在研究,以及利用工具解決!


1、化身福爾摩斯,看圖猜測背景信息:

鯨哥在o3上傳了一張菜單,要求ChatGPT猜出來是哪家飯店。


可以看到o3分析了菜品和價格,并搜索了大眾點評的數據,提出指紋式的菜名+價格組合只有在四季民福出現,最終答對了!


2、識別圖片內容信息,成為植物學家:

識圖能力在此前的眾多大模型中都已經具備,但這次是給大模型加大難度,用一大束花,讓GPT識別都有哪些花束。


最終o3識別出了8種主要的花束,展現了對復雜內容的理解。


3、做考公 圖推題,o3當小學題題目做

在考公題目中,經常有圖推題出現。這些題目往往具有一定的難度,考驗模型對圖片理解以及意識推理的能力。


這道考公題并不容易,GPT用幾種形狀來找規律,最終選擇了答案D。當然,這道題也有爭議,粉筆網給出的答案是D,但很多人認為是B。

只是19秒做完這題,o3估計覺得這題沒多復雜,都是小學生題。


4、數學計算能力更強,重大錯誤比o1強20%

在數學計算中,此前o1開始計算哥德巴赫猜想,讓大家吃了一驚。當然,也沒有計算出來,卻顯示出推理大模型的強悍之處。

鯨哥拿一道DeepSeeK做錯的數學題,考驗o3的進化能力。


這道題不太難,但是DS的幻覺率需要人為矯正。


而o3很快就得出了正確答案,數學題是推理模型的阿克琉斯之踵,o3有進步。


5、調用OpenAI內部工具,除了不能做視頻

在這里,我們先讓o3深度調研下『2025年北京夏天可能火的食物』這一主題。o3從全網內容中獲取了最新的5款食物銷量,得出了結論。


o3最看好 乳茶2.0這款產品,接著讓o3做一張輕乳茶2.0的宣傳海報,o3會思考任務交代中沒有明確提示要Midjourney生成,那就是不僅要生成Prompt,還需要調用4o模型直接生成圖片。


接著我們讓o3直接生成輕乳茶的電商網頁,以動態可視化的HTML網頁形式運行。現在GPT還可以直接運行代碼,實時預覽,很方便。


可以看到右下角還有修復提示,這也是本次o3的重要提升,當它意識到程序有Bug時,就會實時提示可以修復真實代碼,這對于AI編程落地很關鍵。



6、創意視頻生成,后續結合Sora才有前景

o3其實作為LLM,本身不支持生成視頻,但是我們還是要求他生成視頻,考驗它解決問題的思路,這里鯨哥給到的是飛機和魚的創意故事。


o3是逐幀生成了圖片,然后做成gif形式的視頻。

可以看到最終生成的視頻內容,是一架飛機路過,伸出了魚鉤,釣起魚飛走了。這個創意讓我想起來一個歌:『海鳥與魚相愛,只是一場意外』


7、代碼能力和真實物理能力測試

這次公告中,官方稱在“修 bug”基準?SWE中,o3 解決?69.1?% 問題,而 GPT?4o 只解決 33?%左右,代碼能力 ≈2?倍提升。

實測中,生成代碼的審美確實沒什么進步,以下是o3生成的100個小球碰撞的物理實驗,這個效果差強人意。


和下圖對比看,相比o1的還遜色不少,o系列模型確實在代碼編程方面,始終沒有超越Claude3.7。尤其前端UI這塊,水平還是差不少,GPT-4.1也不行。



8、科技商業問題推理,最終寫成文章

在這道題中,鯨哥用比較有門檻的科技商業文作為寫作題目,而且要求中間插入數據分析以及戰略路徑歸納,最終得出結論。


生成的分析深度還可以,只是沒學會吳曉波老師的文筆。

一直以來,ChatGPT的寫作能力都略遜Claude3.7,從目前看,語言的風格化以及潤色程度,比3.7確實還有距離,但是數據和邏輯分析,以及概念的引用都不錯。像是個不經常寫文章,而是經常做研究的博士,寫出來比較硬的內容。


9、視頻分析能力,對多媒體的理解能力

我們在Youtube上找了個萬人大合唱的合集,然后讓他分析這是什么內容,以及為什么能爆火。


o3解讀出了都包括哪些歌,然后分析了爆火的底層邏輯。感覺對于IP孵化類博主是個福音,大家以后能用o3直接寫爆款分析課程了。


10、生成深度研究報告,o3表現更好

我們調用o3模型的深度思考能力,生成了一份行業報告。o3用了不到20分鐘生成了這份1萬多字的報告。


還是先思考后搜索的思路,內容較o1版也有一定程度的提升。

報告全文在這里:https://chatgpt.com/share/6800bf78-bac8-8005-82e4-07c686e121e6

o4mini更適合批量客服回答等強調性價比場景,所以本文沒有測試。Altman還提到,o3 Pro版本將在未來幾周內到達,能力應該比本文測試的o3更強,但也意味著價格更貴。

在Plus賬號中,你能大范圍使用ChatGPT 的所有能力,尤其o3的20美金每月費用,相當于花近200多元雇傭了一個跨學科博士生在身邊做助理,大家覺得值不值呢?

視頻內容推薦:

特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相關推薦
熱點推薦
7號收評:三大指數集體收漲!所有人都注意了,大盤后市或這樣走!

7號收評:三大指數集體收漲!所有人都注意了,大盤后市或這樣走!

春江財富
2026-04-07 15:17:13
確認不打了!廣東第一外援接近常規賽報銷,杜鋒迎來下課倒計時?

確認不打了!廣東第一外援接近常規賽報銷,杜鋒迎來下課倒計時?

緋雨兒
2026-04-07 14:50:06
被成龍稱為頂級美人,62歲高齡,220斤體重,卻依舊美得不可方物

被成龍稱為頂級美人,62歲高齡,220斤體重,卻依舊美得不可方物

觀察鑒娛
2026-02-09 10:40:07
不管在哪上班,要么你是送禮的要么是收禮的,不收不送只會邊緣化

不管在哪上班,要么你是送禮的要么是收禮的,不收不送只會邊緣化

李舟
2026-04-02 18:43:38
A股漲到3890點,尾盤很明顯,明天,4月8日,很可能這樣走

A股漲到3890點,尾盤很明顯,明天,4月8日,很可能這樣走

夜深愛雜談
2026-04-07 16:11:34
霍爾木茲海峽大消息!剛剛,直線拉升

霍爾木茲海峽大消息!剛剛,直線拉升

中國基金報
2026-04-07 10:20:20
“提前還房貸”現象猶在,國有六大行去年個人住房貸款余額集體下降

“提前還房貸”現象猶在,國有六大行去年個人住房貸款余額集體下降

澎湃新聞
2026-04-04 21:38:27
“打開臺灣的眼睛”,島內期待鄭麗文訪陸

“打開臺灣的眼睛”,島內期待鄭麗文訪陸

環球網資訊
2026-04-07 06:56:17
兵敗如山倒?多家日企接連撤離中國,中日制造或已迎來了大反轉

兵敗如山倒?多家日企接連撤離中國,中日制造或已迎來了大反轉

史智文道
2026-04-07 15:04:35
伊朗革命衛隊稱以色列海法已被“全面打擊”

伊朗革命衛隊稱以色列海法已被“全面打擊”

財聯社
2026-04-07 09:47:18
陳麗華辭世:巨額遺產分配合理,“唐僧”遲重瑞可按理想方式養老

陳麗華辭世:巨額遺產分配合理,“唐僧”遲重瑞可按理想方式養老

社會日日鮮
2026-04-07 12:34:25
中國不記隔夜仇!巴拿馬接到通知,美國終于下場,巴政府自食惡果

中國不記隔夜仇!巴拿馬接到通知,美國終于下場,巴政府自食惡果

影孖看世界
2026-04-06 14:09:23
英超青年杯:浙江2-1狼隊,陳佳樂破門,陳澤軒世界波絕殺

英超青年杯:浙江2-1狼隊,陳佳樂破門,陳澤軒世界波絕殺

懂球帝
2026-04-07 13:39:09
博主自稱在韓國讀漢語言文學博士,畢業半年找不到工作,網友:太抽象了

博主自稱在韓國讀漢語言文學博士,畢業半年找不到工作,網友:太抽象了

可達鴨面面觀
2026-04-07 13:02:01
東西部對陣基本確定!雷霆騎士成季后賽最大贏家,掘馬、綠尼互撕

東西部對陣基本確定!雷霆騎士成季后賽最大贏家,掘馬、綠尼互撕

你的籃球頻道
2026-04-07 16:02:01
30歲女高管自述感染艾滋病經歷:我以為他沒病,可是我錯了

30歲女高管自述感染艾滋病經歷:我以為他沒病,可是我錯了

千秋文化
2026-04-05 19:05:24
為什么沒人聯合打以色列,答案很簡單:不是沒人想打,是沒人敢打

為什么沒人聯合打以色列,答案很簡單:不是沒人想打,是沒人敢打

墨印齋
2026-04-07 13:47:02
頭孢克肟的“肟”不讀kuī,太多人不知道!正確讀音意思一次講清

頭孢克肟的“肟”不讀kuī,太多人不知道!正確讀音意思一次講清

未央看點
2026-04-05 15:50:19
周杰倫現身意大利摩德納 定制專屬法拉利V12超級跑車

周杰倫現身意大利摩德納 定制專屬法拉利V12超級跑車

快科技
2026-04-07 15:14:06
體檢報告出現這幾個字,距離癌癥只有一步之遙!別等得癌了才后悔

體檢報告出現這幾個字,距離癌癥只有一步之遙!別等得癌了才后悔

藥到福至
2026-04-06 17:02:49
2026-04-07 19:19:00
鯨選AI incentive-icons
鯨選AI
最新AI產品化與商業化案例速遞
146文章數 36關注度
往期回顧 全部

科技要聞

滿嘴謊言!OpenAI奧特曼黑料大起底

頭條要聞

英媒:伊朗最高領袖病重昏迷 無法參與任何國家決策

頭條要聞

英媒:伊朗最高領袖病重昏迷 無法參與任何國家決策

體育要聞

官宣簽約“AI球員”,這支球隊被罵慘了...

娛樂要聞

女首富陳麗華離世 被曝生前已分好遺產

財經要聞

10萬億財政轉移支付,被誰拿走了?

汽車要聞

不止是大 極狐首款MPV問道V9靜態體驗

態度原創

健康
藝術
家居
旅游
公開課

干細胞抗衰4大誤區,90%的人都中招

藝術要聞

美麗風光看不盡

家居要聞

雅致愜意 感知生活之美

旅游要聞

2026年清明節假期國內出游1.35億人次

公開課

李玫瑾:為什么性格比能力更重要?

無障礙瀏覽 進入關懷版