新聞中心News

聯(lián)系方式Contact Us

深圳市聚泓瀚科技有限公司
地址：深圳市寶安區(qū)松崗街道廣深路松崗段2號(hào)廠房宇恒工業(yè)園1棟4樓
手機(jī)：13923733903
郵箱：kevin@juhonghan.com
網(wǎng)址：yqmpw.cn

行業(yè)新聞

OCR文字識(shí)別

發(fā)布時(shí)間：2018-10-24 閱覽次數(shù)：1176 次

CR（optical character recognition）文字識(shí)別是指電子設(shè)備（例如掃描儀或數(shù)碼相機(jī)）檢查紙上打印的字符，然后用字符識(shí)別方法將形狀翻譯成計(jì)算機(jī)文字的過程；即，對(duì)文本資料進(jìn)行掃描，然后對(duì)圖像文件進(jìn)行分析處理，獲取文字及版面信息的過程。如何除錯(cuò)或利用輔助信息提高識(shí)別正確率，是OCR最重要的課題的友好性，產(chǎn)品的穩(wěn)定性，易用性及可行性等。

中文名OCR文字識(shí)別外文名Optical Character Recognition

歷史背景

編輯

光學(xué)文字識(shí)別的概念是在1929年由德國科學(xué)家Tausheck最先提出來的，后來美國科學(xué)家Handel也提出了利用技術(shù)對(duì)文字進(jìn)行識(shí)別的想法。而最早對(duì)印刷體漢字識(shí)別進(jìn)行研究的是IBM公司的Casey和Nagy，1966年他們發(fā)表了第一篇關(guān)于漢字識(shí)別的文章，采用了模板匹配法識(shí)別了1000個(gè)印刷體漢字。
　　早在60、70年代，世界各國就開始有OCR的研究，而研究的初期，多以文字的識(shí)別方法研究為主，且識(shí)別的文字僅為0至9的數(shù)字。以同樣擁有方塊文字的日本為例，1960年左右開始研究OCR的基本識(shí)別理論，初期以數(shù)字為對(duì)象，直至1965至1970年之間開始有一些簡(jiǎn)單的產(chǎn)品，如印刷文字的郵政編碼識(shí)別系統(tǒng)，識(shí)別郵件上的郵政編碼，幫助郵局作區(qū)域分信的作業(yè)；也因此至今郵政編碼一直是各國所倡導(dǎo)的地址書寫方式。

20世紀(jì)70年代初，日本的學(xué)者開始研究漢字識(shí)別，并做了大量的工作。中國在OCR技術(shù)方面的研究工作起步較晚，在70年代才開始對(duì)數(shù)字、英文字母及符號(hào)的識(shí)別進(jìn)行研究，70年代末開始進(jìn)行漢字識(shí)別的研究，到1986年漢字識(shí)別的研究進(jìn)入一個(gè)實(shí)質(zhì)性的階段，不少研究單位相繼推出了中文OCR產(chǎn)品.早期的OCR軟件，由于識(shí)別率及產(chǎn)品化等多方面的因素，未能達(dá)到實(shí)際要求。同時(shí)，由于硬件設(shè)備成本高，運(yùn)行速度慢，也沒有達(dá)到實(shí)用的程度。只有個(gè)別部門，如信息部門、新聞出版單位等使用OCR軟件。

1986年以后我國的OCR研究有了很大進(jìn)展，在漢字建模和識(shí)別方法上都有所創(chuàng)新，在系統(tǒng)研制和開發(fā)應(yīng)用中都取得了豐碩的成果，不少單位相繼推出了中文OCR產(chǎn)品。

進(jìn)入20世紀(jì)90年代以后，隨著平臺(tái)式掃描儀的廣泛應(yīng)用，以及我國信息自動(dòng)化和辦公自動(dòng)化的普及，大大推動(dòng)了OCR技術(shù)的進(jìn)一步發(fā)展，使OCR的識(shí)別正確率、識(shí)別速度滿足了廣大用戶的要求。其中以O(shè)CR為科技核心的云脈技術(shù)不斷創(chuàng)新進(jìn)取，研發(fā)了一系列OCR軟件產(chǎn)品，并且運(yùn)用在醫(yī)院，學(xué)校，企業(yè)等各大市場(chǎng)。

軟件結(jié)構(gòu)

編輯

由于掃描儀的普及與廣泛應(yīng)用，OCR軟件只需提供與掃描儀的接口，利用掃描儀驅(qū)動(dòng)軟件即可。因此，OCR軟件主要是由下面幾個(gè)部分組成。
　　1、圖像輸入、預(yù)處理：
　　圖像輸入：對(duì)于不同的圖像格式，有著不同的存儲(chǔ)格式，不同的壓縮方式。預(yù)處理：主要包括二值化，噪聲去除，傾斜較正等
　　2、二值化：
　　對(duì)攝像頭拍攝的圖片，大多數(shù)是彩色圖像，彩色圖像所含信息量巨大，對(duì)于圖片的內(nèi)容，我們可以簡(jiǎn)單的分為前景與背景，為了讓計(jì)算機(jī)更快的，更好的識(shí)別文字，我們需要先對(duì)彩色圖進(jìn)行處理，使圖片只前景信息與背景信息，可以簡(jiǎn)單的定義前景信息為黑色，背景信息為白色，這就是二值化圖了。
　　3、噪聲去除：
　　對(duì)于不同的文檔，我們對(duì)噪聲的定義可以不同，根據(jù)噪聲的特征進(jìn)行去噪，就叫做噪聲去除
　　4、傾斜較正：
　　由于一般用戶，在拍照文檔時(shí)，都比較隨意，因此拍照出來的圖片不可避免的產(chǎn)生傾斜，這就需要文字識(shí)別軟件進(jìn)行較正。
　　版面分析：
　　5、將文檔圖片分段落，分行的過程就叫做版面分析，由于實(shí)際文檔的多樣性，復(fù)雜性，因此，目前還沒有一個(gè)固定的，最優(yōu)的切割模型。
　　6、字符切割：
　　由于拍照條件的限制，經(jīng)常造成字符粘連，斷筆，因此極大限制了識(shí)別系統(tǒng)的性能，這就需要文字識(shí)別軟件有字符切割功能。
　　7、字符識(shí)別：
　　這一研究，已經(jīng)是很早的事情了，比較早有模板匹配，后來以特征提取為主，由于文字的位移，筆畫的粗細(xì)，斷筆，粘連，旋轉(zhuǎn)等因素的影響，極大影響特征的提取的難度。
　　8、版面恢復(fù)：
　　人們希望識(shí)別后的文字，仍然像原文檔圖片那樣排列著，段落不變，位置不變，順序不變，的輸出到word文檔,pdf文檔等，這一過程就叫做版面恢復(fù)。
　　9、后處理、校對(duì)：
　　根據(jù)特定的語言上下文的關(guān)系，對(duì)識(shí)別結(jié)果進(jìn)行較正，就是后處理。
　　開發(fā)一個(gè)OCR文字識(shí)別軟件系統(tǒng)，其目的很簡(jiǎn)單，只是要把影像作一個(gè)轉(zhuǎn)換，使影像內(nèi)的圖形繼續(xù)保存、有表格則表格內(nèi)資料及影像內(nèi)的文字，一律變成計(jì)算機(jī)文字，使能達(dá)到影像資料的儲(chǔ)存量減少、識(shí)別出的文字可再使用及分析，當(dāng)然也可節(jié)省因鍵盤輸入的人力與時(shí)間。

從影像到結(jié)果輸出，須經(jīng)過影像輸入、影像前處理、文字特征抽取、比對(duì)識(shí)別、最后經(jīng)人工校正將認(rèn)錯(cuò)的文字更正，將結(jié)果輸出。

返回列表