OCR (Optical Character Recognition,光學(xué)字符識別)是指電子設(shè)備(例如掃描儀或數(shù)碼相機)檢查紙上打印的字符,通過檢測暗、亮的模式確定其形狀,然后用字符識別方法將形狀翻譯成計算機文字的過程;即,針對印刷體字符,采用光學(xué)的方式將紙質(zhì)文檔中的文字轉(zhuǎn)換成為黑白點陣的圖像文件,并通過識別軟件將圖像中的文字轉(zhuǎn)換成文本格式,供文字處理軟件進(jìn)一步編輯加工的技術(shù)。如何除錯或利用輔助信息提高識別正確率,是OCR的課題,ICR(Intelligent Character Recognition)的名詞也因此而產(chǎn)生。衡量一個OCR系統(tǒng)性能好壞的主要指標(biāo)有:拒識率、誤識率、識別速度、用戶界面的友好性,產(chǎn)品的穩(wěn)定性,易用性及可行性等。

噪聲去除:對于不同的文檔,我們對噪聲的定義可以不同,根據(jù)噪聲的特征進(jìn)行去噪,就叫做噪聲去除傾斜較正:由于一般用戶,在拍照文檔時,都比較隨意,因此拍照出來的圖片不可避免的產(chǎn)生傾斜,這就需要文字識別軟件進(jìn)行較正。版面分析:將文檔圖片分段落,分行的過程就叫做版面分析,由于實際文檔的多樣性,復(fù)雜性,因此,目前還沒有一個固定的,的切割模型。

字符切割:由于拍照條件的限制,經(jīng)常造成字符粘連,斷筆,因此極大限制了識別系統(tǒng)的性能,這就需要文字識別軟件有字符切割功能。字符識別:這一研究,已經(jīng)是很早的事情了,比較早有模板匹配,后來以特征提取為主,由于文字的位移,筆畫的粗細(xì),斷筆,粘連,旋轉(zhuǎn)等因素的影響,極大影響特征的提取的難度。版面恢復(fù):人們希望識別后的文字,仍然像原文檔圖片那樣排列著,段落不變,位置不變,順序不變地輸出到word文檔、pdf文檔等,這一過程就叫做版面恢復(fù)。后處理、校對:根據(jù)特定的語言上下文的關(guān)系,對識別結(jié)果進(jìn)行較正,就是后處理。工作流程編輯一個OCR識別系統(tǒng),其目的很簡單,只是要把影像作一個轉(zhuǎn)換,使影像內(nèi)的圖形繼續(xù)保存、有表格則表格內(nèi)資料及影像內(nèi)的文字,一律變成計算機文字,使能達(dá)到影像資料的儲存量減少、識別出的文字可再使用及分析,當(dāng)然也可節(jié)省因鍵盤輸入的人力與時間。

工業(yè)讀碼器系列SuperHD-Read36SuperHD-Read120SuperHD-Read200像素大小(H×V)752×4801280×9601920×1200傳感器型號MT9V034MT9M031IMX249傳感器光學(xué)尺寸1/3-inch1/3-inch1/1.2-inch像素尺寸(um)6.0×6.05.2×5.25.86×5.86全幅幀率(fps)502815快門方式全局快門CMOS
全局快門CMOS
全局快門CMOS相機輸出接口10/100M以太網(wǎng)自適應(yīng);TCP/IP協(xié)議;FTP協(xié)議;其他通訊接口RS232串口、RS485圖像采集方式軟件觸發(fā)采集、外部IO觸發(fā)采集、外設(shè)觸發(fā)采集輸入輸出IO3通道隔離輸入、3通道隔離輸出存儲8MByte線性Flash存儲;8~32GByte SD卡存儲其他功能遠(yuǎn)程復(fù)位、看門狗功能 電源及功耗12V直流輸入/3.6W功耗4.8W功耗工作溫度零下20度到零上65度