LMArena(Large Model Arena)是能免費客觀比較各種AI模型的平台。此服務最大的特色,在於使用者在不知道模型名稱的情況下比較回答結果的盲測系統。
LMArena的創新之處,在於能不帶先入為主的觀念進行公平評估。由於投票後才會公開模型名稱,因此評估依據的並非行銷宣傳詞句,而是實際的性能表現。
主要特色
- 完全免費:無需特別註冊或登入
- 匿名評分系統:在隱藏模型名稱的狀態下進行比較
- ELO評等:根據使用者投票的排名
- 支援最新模型:可測試OpenAI、Google、Anthropic、Mistral等主要企業的最新模型
LMArena的基本使用方法
步驟1:進入網站
首先,在瀏覽器中開啟 lmarena.ai。無需特別註冊,可立即開始使用。
步驟2:選擇功能
在LMArena中,可透過畫面上方的標籤切換以下功能:
- Battle(對戰):文字生成AI的比較
- Side by Side(並排比較):生成式AI的比較
- Direct Chat(直接對話):選擇生成式AI直接使用
各功能的詳細使用方法
以下將詳細解說LMArena主要功能「Battle」「Side by Side」「Direct Chat」的使用方法。
Battle:生成式AI的比較
Battle功能是以盲測方式比較並投票兩個生成式AI回答的機制。
1. 輸入提示詞

選擇網站中的「Battle」,輸入問題或指令文字(提示詞)。
2. 生成回答

兩個不同的AI模型會針對相同的提示詞作答,回答會在不知道是哪個模型的狀態下顯示出來。
3. 比較與投票
點選您認為較優的回答(A或B)。
4. 顯示結果・學習

投票後,才會首次得知各回答分別出自哪個AI模型。投票結果會反映在ELO評等中,更新模型的排名。
主要用途:適合想公平比較各模型實力、想在排除行銷因素下了解實際性能的情況。
Side by Side:生成式AI的比較
Side by Side是將多個生成式AI的回答並排顯示,可直接比較內容的功能。
1. 輸入提示詞

在「Side by Side」標籤中輸入問題或指令。
2. 選擇模型(視情況而定)
可選擇要比較的AI模型,或由平台自動選出多個模型。
3. 顯示回答
多個(通常為3~5個)模型的回答會橫向並排顯示,可一目瞭然地確認各回答的差異。
4. 比較與分析

可仔細比較分析內容、品質、風格等(部分情況下不具投票功能)。
主要用途:推薦給想綜觀多個AI優缺點、或想在研究與業務用途上進行詳細分析的情況。
Direct Chat:選擇生成式AI直接使用
Direct Chat是可指定喜歡的生成式AI模型,直接體驗對話或生成的功能。
1. 選擇AI模型
在「Direct Chat」標籤中明確選擇想使用的AI模型(例如:ChatGPT、Claude、Gemini等)。
2. 開始對話
輸入提示詞、問題或指令文字,開始對話或生成。
3. 應用方式

可依用途活用於一般問題、創意產出、程式碼生成、圖像生成(限支援的模型)等。
主要用途:適合想單獨體驗特定AI模型能力、想進行貼近實際業務的測試,或想進行提示詞調整與研究的情況。
什麼是Leaderboard(排行榜)
LMArena的Leaderboard(排行榜)是將Battle、Side-by-Side等收集到的投票結果,以Elo評等數值化,為生成式AI模型排名的公開排行榜。
‐ 擊敗的對手愈強,加分愈多;輸給較弱的對手則會大幅扣分,因此僅憑僥倖獲勝無法長期停留在排行榜前段。
‐ 排行榜每隔數小時至數天會自動更新,每當新增GPT-5、Gemini 2.5 Pro等最新模型時,排名就會隨之變動。
LMArena的應用優勢
商業應用
LMArena能在高額導入前,進行模擬實際業務情境的性能比較,對小型企業而言特別具有價值。可運用於以下用途:
- AI工具導入前的性能比較
- 選定最適合業務效率化的模型
- 客觀評估多個AI服務
學習・研究用途
- 掌握最新AI模型的性能趨勢
- 理解AI的能力與限制
- 提示詞工程的練習
總結
LMArena是一個透過匿名評分系統,實現中立公平之AI模型比較的創新平台。能免費測試Google Gemini、ChatGPT、Claude等最新模型,並進行不受行銷偏見影響、以實際性能為依據的客觀評估。
正在考慮選定或導入AI工具的人,建議先在LMArena進行免費測試,找出最適合自身用途的模型。由於未來也預計新增更多專業評分工具,LMArena在掌握AI業界動向方面,也將成為一個重要的平台。
