跳到主要內容

Chandra OCR 本地部署與實測驗證完整指南

Chandra OCR 是一款功能強大的開源 OCR 模型,專為解決複雜排版、長文檔、模糊掃描件的識別難題而設計 [00:17, 00:54]。它具備 9B 參數,支持超過40種語言(包含中文及手寫體),並能進行結構化輸出(如 Markdown, HTML),有效處理表格、公式、頁眉頁腳等複雜元素 [01:26]。

一、 安裝與部署步驟

影片介紹了兩種部署方式,一種是透過 M Studio (應為 LM Studio) 的簡易安裝,另一種是透過官方倉庫在 Ubuntu 系統上進行本地部署。

方式一:M Studio (簡易安裝)

  1. 在 M Studio 中,點擊「發現」(Discover) [02:02]。
  2. 在搜索框中輸入模型名稱(Chandra OCR)。
  3. 選擇 4-bit 或 8-bit 的量化版本。
  4. 點擊「下載」即可開始使用 [02:12]。

方式二:官方倉庫本地部署 (以 Ubuntu 為例)

影片重點演示了在 Ubuntu 系統上的部署流程 [02:23]:

  1. 安裝 uv:

    # 執行命令安裝 uv
    [00:02:27] (影片中顯示了相關命令)
  2. 克隆 (Clone) 官方倉庫:

    # 執行 git clone 命令
    [00:02:30] (影片中顯示了相關命令)
  3. 進入項目目錄:

    # 執行 cd 命令進入項目路徑
    [00:02:34] (影片中顯示了相關命令)
  4. 安裝項目依賴:

    # 使用 uv 命令安裝項目
    [00:02:38] (影片中顯示了相關命令)
  5. 激活虛擬環境:

    # 執行命令激活虛擬環境
    [00:02:43] (影片中顯示了相關命令)
  6. 安裝 Chandra OCR:

    # 使用 pip 命令安裝
    [00:02:47] (影片中顯示了相關命令)

二、 啟動與測試驗證

部署完成後,影片展示瞭如何啟動 Web UI 界面並進行多項功能驗證。

啟動 Web UI

  1. 執行官方提供的命令來啟動 Demo UI [02:59]。
  2. 啟動成功後,在瀏覽器中打開對應的本地地址 [03:06]。
  3. 在 UI 界面左側,點擊下拉菜單並選擇「HF」來加載模型。此時後端會開始下載模型權重文件 [03:13]。

實測驗證

影片使用了多種複雜文檔來驗證 Chandra OCR 的強大能力:

  1. 測試 1: 長文檔掃描件 (含頁眉頁腳)

    • 內容: 包含頁眉和底部頁腳的掃描PDF [03:26]。
    • 結果: 成功識別並提取了頁眉和頁腳的內容 [03:46],這在其他模型(如 DeepSeek OCR)中會被遺漏 [00:37]。輸出保留了原文的分段格式(使用 HTML P 標籤) [03:53]。
  2. 測試 2: 手寫體文件

    • 內容: 一份手寫文件 [04:28]。
    • 結果: 識別結果與原文件完全一致,沒有任何識別錯誤 [04:35]。
  3. 測試 3: 模糊 PDF (中文 + 重疊代碼)

    • 內容: 包含中文、小字體,以及故意設置為有重疊區域的代碼 [04:48]。
    • 結果: 成功保留了標題的加粗格式 [04:55],並準確提取了重疊部分的代碼 [05:06] 和文檔中的序號 [05:13]。
  4. 測試 4: 模擬考試卷 (含注音)

    • 內容: 包含複雜排版和注音的考試卷 [05:20]。
    • 結果: 完美保持了試題的原有格式 [05:30],連同試題中的注音符號也成功顯示 [05:37]。同時提取了左側邊欄和底部的頁碼 [05:44]。
  5. 測試 5: 複雜排版論文 (中英、公式、表格)

    • 內容: 非常模糊、排版複雜,包含中英文、數學公式和表格的論文掃描件 [05:50]。
    • 結果: 準確還原了格式(如標題加粗) [06:02],數學公式 [06:15] 和表格內容 [06:18] 均被正確提取。
  6. 測試 6: 混亂排版的學習筆記

    • 內容: 排版隨意,包含對號、差號、星號和角落小字的筆記 [06:42]。
    • 結果: 準確識別了對號(✓)和差號(✗) [06:52],保留了星號(*) [07:05],並成功提取了右上角的小字和左下角的紅色關鍵字 [07:09]。
  7. 測試 7: 複雜表格 (含重疊文字)

    • 內容: 故意在單元格中設置重疊文字的模糊表格 [07:26]。
    • 結果: 即使是重疊的文字,模型也能成功並準確地提取出來 [07:43, 07:49]。
  8. 測試 8: 複雜文件 (含圖表)

    • 內容: 包含柱狀圖和表格的模糊文件 [08:06]。
    • 結果: 成功將掃描件中的柱狀圖直接提取為圖像格式進行展示 [08:17],表格內容也準確提取 [08:25]。
  9. 測試 9: 古書掃描件 (繁體字)

    • 內容: 豎排版的繁體字古書 [08:28]。
    • 結果: 準確識別了所有繁體字及標點符號,與原文保持一致,沒有錯誤 [08:42]。

總結

Chandra OCR 在處理各種極端複雜和模糊的文檔時表現出色,不僅識別準確率高,還能保留原始格式、處理圖表,並且不會遺漏頁眉頁腳等關鍵內容,對於需要處理複雜 PDF 文檔的場景,是一款效果非常優秀的模型。

本文內容根據影片(🚀超越DeepSeek-OCR!OCR领域的革命性突破:Chandra OCR本地部署+真实测评! ,涵蓋了安裝部署與測試驗證。

留言

這個網誌中的熱門文章

Vibe Coding:到底?氛圍驅動程式開發必殺技?

Vibe Coding(氛圍編程) 是由 OpenAI 共同創辦人 Andrej Karpathy 在 2025 年提出的革命性程式開發方式,它讓開發者透過自然語言與 AI 對話來生成程式碼,徹底改變了傳統的編程模式。 這種開發方式的核心理念是 「順著感覺走」 ,讓 AI 處理技術細節,開發者專注於創意和需求描述。 Vibe Coding 需要基本上的規劃和執行,但並沒有強制規範,從日常經驗來說可分為三個階段, 前期準備、開發過程、和後期維護 三個關鍵階段。每個階段都有其特定的任務和注意事項,正確執行這些步驟將大幅提升開發效率和程式品質。 將靈感與需求透過 AI 快速轉化成產品功能或原型。以下幫你分成 「前、中、後」 三階段要做的事情,適合你自己做、或帶團隊做 前期:設定 vibe & 準備素材 這個階段的重點是 「建立開發語境」 ,因為 AI 的生成表現高度依賴前期提供的上下文與資料。 明確目標 :釐清要解決的問題、預期要做的功能與核心價值。例如在筆記軟體的情境中,可能是:「我要做一款讓使用者能用 Markdown 記錄筆記,並提供標籤與全文搜尋功能的簡單 App。」 收集靈感 :觀察同類產品(如 Obsidian、Notion)、蒐集市場痛點(例如太多筆記軟體無法脫機使用,或同步效能差)。 建立語境 :準備初步 prompt、背景知識、產品定位、品牌調性、目標使用者輪廓等。 確認資源 :決定用哪些工具(Gemini、ChatGPT、設計軟體、流程管理工具等)。 確認完上述內容之後,就可以先開始進行準備規格,進行第一次的 Vibe Coding 方向驗證 提示詞模板準備 很多人會跳過這步驟,但一份 「好的 AI 提示詞模板」 將決定接下來每一次 AI 對話的品質。有效的提示詞模板需具備: 描述具體且無歧義 包含技術要求和約束條件 提供範例資料和測試案例 指定程式碼風格和慣例 例如針對筆記軟體的案例:   「建立一個支援 AI 功能純文字筆記,輸入內容可即時渲染;需支援儲存到本地檔案,提供標籤欄位做分類;以 React 架構,程式風格採用 Tailwind style components 並使用 hooks。」 開發工具選擇 開發工具的選擇 同樣重要,目前市場上主要的 ...

Claude Code Hooks:自動化與安全的最佳實踐

寫在最前頭,這份文章主要寫起來是給自己看, 同時內容是比較適合開發者,工程師們可以做些自動化處理的簡單筆記。 Claude Code hooks Claude Code hooks 是一種強大的自動化機制,允許用戶在 Claude Code 的不同生命週期階段,自定義執行 shell 指令。這種設計讓開發者能夠將規則和自動化行為嵌入到應用層級,確保每次都能可靠執行,而不必依賴 LLM(大型語言模型)是否會選擇執行某項操作。 Hooks 的核心用途 通知 :自訂收到 Claude Code 等待用戶輸入或執行權限時的提醒方式。 自動格式化 :如在每次檔案編輯後自動執行 prettier (針對 .ts 檔)、 gofmt (針對 .go 檔)等。 日誌記錄 :追蹤所有執行過的命令,便於合規或除錯。 自動反饋 :當 Claude Code 產生不符合團隊規範的程式碼時,自動給出反饋。 自訂權限 :阻擋對生產環境檔案或敏感目錄的修改[^1]。 配置與結構 Hooks 透過設定檔進行配置,分為全域( ~/.claude/settings.json )、專案( .claude/settings.json )、本地專案( .claude/settings.local.json )以及企業級策略設定。每個 hook 由「事件名稱」和「匹配器」組成: "hooks": { "PreToolUse": [ { "matcher": "Bash", "hooks": [ { "type": "command", "command": "jq -r '...'" } ] } ] } matcher :用於匹配工具名稱(支援正則表達式),如 Write 、 Edit|Write 、 Notebook.* 。 hooks :當匹配時要執行的命令陣列。 type :目前僅支援 "command" 。 ...

[CSS] z-index 在不同瀏覽器繼承問題

今天會討論到這個課題,是因為要實做一個Popup dialog,所以我們希望的結果如下圖。 可是在IE7 卻發生了這樣的情況。 Popup不論怎麼設定z-index都無法浮在最上層,我們看一下html架構發生什麼事情。