新四季網

怎麼用?印表機掃描文件

2023-03-29 02:50:39

能 OCR 所謂OCR (Optical Character Recognition光學字符識別)技術,是指電子設備(例如掃描儀或數位相機)檢查紙上列印的字符,通過檢測暗、亮的模式確定其形狀,然後用字符識別方法將形狀翻譯成計算機文字的過程;即,對文本資料進行掃描,然後對圖像文件進行分析處理,獲取文字及版面信息的過程。

由於OCR是一門與識別率拔河的技術,因此如何除錯或利用輔助信息提高識別正確率,是OCR最重要的課題,ICR(Intelligent Character Recognition)的名詞也因此而產生。而根據文字資料存在的媒體介質不同,及取得這些資料的方式不同,就衍生出各式各樣、各種不同的應用。

一、OCR的發展 要談OCR的發展,早在60、70年代,世界各國就開始有OCR的研究,而研究的初期,多以文字的識別方法研究為主,且識別的文字僅為0至9的數字。以同樣擁有方塊文字的日本為例,1960年左右開始研究OCR的基本識別理論,初期以數字為對象,直至1965至1970年之間開始有一些簡單的產品,如印刷文字的郵政編碼識別系統,識別郵件上的郵政編碼,幫助郵局作區域分信的作業;也因此至今郵政編碼一直是各國所倡導的地址書寫方式。

OCR可以說是一種不確定的技術研究,正確率就像是一個無窮趨近函數,知道其趨近值,卻只能靠近而無法達到,永遠在與100%作拉鋸戰。因為其牽扯的因素太多了,書寫者的習慣或文件印刷品質、掃描儀的掃描品質、識別的方法、學習及測試的樣本……等等,多少都會影響其正確率,也因此, OCR的產品除了需有一個強有力的識別核心外,產品的操作使用方便性、所提供的除錯功能及方法,亦是決定產品好壞的重要因素。

一個OCR識別系統,其目的很簡單,只是要把影像作一個轉換,使影像內的圖形繼續保存、有表格則表格內資料及影像內的文字,一律變成計算機文字,使能達到影像資料的儲存量減少、識別出的文字可再使用及分析,當然也可節省因鍵盤輸入的人力與時間。 從影像到結果輸出,須經過影像輸入、影像前處理、文字特徵抽取、比對識別、最後經人工校正將認錯的文字更正,將結果輸出。

在此逐一介紹: 影像輸入: 欲經過OCR處理的標的物須透過光學儀器,如影像掃描儀、傳真機或任何攝影器材,將影像轉入計算機。科技的進步,掃描儀等的輸入裝置已製作的愈來愈精緻,輕薄短小、品質也高,對OCR有相當大的幫助,掃描儀的解析度使影像更清晰、掃除速度更增進OCR處理的效率。

影像前處理:影像前處理是OCR系統中,須解決問題最多的一個模塊,從得到一個不是黑就是白的二值化影像,或灰階、彩色的影像,到獨立出一個個的文字影像的過程,都屬於影像前處理。包含了影像正規化、去除噪聲、影像矯正等的影像處理,及圖文分析、文字行與字分離的文件前處理。

在影像處理方面,在學理及技術方面都已達成熟階段,因此在市面上或網站上有不少可用的連結庫;在文件前處理方面,則憑各家本領了;影像須先將圖片、表格及文字區域分離出來,甚至可將文章的編排方向、文章的提綱及內容主體區分開,而文字的大小及文字的字體亦可如原始文件一樣的判斷出來。 文字特徵抽取:單以識別率而言,特徵抽取可說是 OCR的核心,用什麼特徵、怎麼抽取,直接影響識別的好壞,也所以在OCR研究初期,特徵抽取的研究報告特別的多。

而特徵可說是識別的籌碼,簡易的區分可分為兩類:一為統計的特徵,如文字區域內的黑/白點數比,當文字區分成好幾個區域時,這一個個區域黑/白點數比之聯合,就成了空間的一個數值向量,在比對時,基本的數學理論就足以應付了。 而另一類特徵為結構的特徵,如文字影像細線化後,取得字的筆劃端點、交叉點之數量及位置,或以筆劃段為特徵,配合特殊的比對方法,進行比對,市面上的線上手寫輸入軟體的識別方法多以此種結構的方法為主。

對比資料庫:當輸入文字算完特徵後,不管是用統計或結構的特徵,都須有一比對資料庫或特徵資料庫來進行比對,資料庫的內容應包含所有欲識別的字集文字,根據與輸入文字一樣的特徵抽取方法所得的特徵群組。 對比識別: 這是可充分發揮數學運算理論的一個模塊,根據不同的特徵特性,選用不同的數學距離函數,較有名的比對方法有,歐式空間的比對方法、鬆弛比對法(Relaxation)、動態程序比對法(Dynamic Programming,DP),以及類神經網絡的資料庫建立及比對、HMM(Hidden Markov Model)…等著名的方法,為了使識別的結果更穩定,也有所謂的專家系統(Experts System)被提出,利用各種特徵比對方法的相異互補性,使識別出的結果,其信心度特別的高。

字詞後處理:由於OCR的識別率並無法達到百分之百,或想加強比對的正確性及信心值,一些除錯或甚至幫忙更正的功能,也成為OCR系統中必要的一個模塊。字詞後處理就是一例,利用比對後的識別文字與其可能的相似候選字群中,根據前後的識別文字找出最合乎邏輯的詞,做更正的功能。

字詞資料庫:為字詞後處理所建立的詞庫。 人工校正: OCR最後的關卡,在此之前,使用者可能只是拿支滑鼠,跟著軟體設計的節奏操作或僅是觀看,而在此有。

同类文章

怎麼把硬幣弄一個孔

簡單的一個小魔術 準備:撲克牌一副表演:1.讓觀眾去洗牌2.拿起觀眾洗過的牌,翻開來檢查一下(最好別人觀眾看到你檢查的細節),檢查時只要看看牌頂數起的頭兩張牌,如果這兩張牌的花不同就OK,如果是一樣的話,就說「你洗得不夠亂,再洗一次」.如此直到目的達成.3.檢查完後,告訴觀眾這次是由魔術師來負責抽牌

微博評論沉底是為啥

微博評論沉底說明微博的評論不精彩。微博評論會根據評論的內容和點讚次數才設置能否置頂,評論如果十分精彩,會很順利置頂。如果評論很精彩,並且點讚人數很多,可以和置頂的評論點讚數對比,如果數量十分相近,可能是微博問題,建議卸載重新裝載微博。

有哪些好的體育公眾號

以下是幾個比較好的知名體育公眾號:1.搜狐體育。這個體育公眾號經常發一些體育直播,一些體育賽事的報導和專家點評,內容相對比較豐富,也有許多體育圖片可看。2.央視網體育。這個體育公眾號是由央視推廣的一個體育的公眾號,是中國網絡電視臺體育臺的官方微信,體育資訊比較豐富。3.新浪體育。這個體育公眾號裡面有

怎麼把鍵盤上的輸入

在電腦上打出減號的方法:shift+-方法一、1、圖中的2個鍵一起按。注意:輸入法為英文狀態下的才是減號。方法二、1、如果鍵盤有小鍵盤。直接在小鍵盤上按【-】號即可。方法三、1、輸入法自帶的有符號。如下圖。

婊貝

就是小寶貝的意思。 關於【寶貝】的名詞解釋: 本詞有兩種解釋。第一種解釋把「寶」與「貝」都看成是名詞,把「寶貝」看成名詞與名詞聯合的詞組。這樣的話,「寶」指收藏品,特指瓷器收藏品,尤指可以買賣的收藏品;「貝」指「錢幣」。「寶貝」可以理解為「收藏品和錢幣」。 第二種解釋把「寶」看成形容詞,意為「珍

深圳市高新科技園南區郵編是多少

深圳市高新科技園南區郵編:518000。深圳市高新技術產業園區成立於1996年9月,面積11點5平方公裡,是國家科技部建設世界一流科技園區發展戰略的6家試點園區之一。是國家級高新技術產品出口基地、亞太經合組織開放園區、先進國家高新技術產業開發區、國家智慧財產權試點園區、中國青年科技創新行動示範基地、

小天鵝滾筒洗衣機溫度下面長按3秒什麼意思

小天鵝滾筒洗衣機溫度下面長按3秒是將洗衣機鎖定的意思。小天鵝全自動洗衣機用法介紹:1. 小天鵝全自動波輪洗衣機連接好電源,保證電源線路安裝漏保和接地,否則可能發生嚴重的觸電事故。2.安裝好自動水龍頭,保證地面平穩。3.把要洗滌的衣物和洗衣粉及添加劑放入入洗衣機內,並將機蓋關上點擊「開始」按鈕即可。

怎麼把顆粒狀的磨成粉

顆粒狀的餌料是相對粉狀、片狀餌料而存在的,他的用途很廣可以直接拋投做窩也可以成為釣餌,對於大魚和滑魚有很好的效果不過對於如何開制顆粒餌目前還是存在比較大的爭議,有些人覺得使用前應該先打成粉,另一些人覺得直接泡開就可以了,至於理由雙方也很明確認為要打粉的釣友表示直接泡開不但浪費做釣的時間而且浸

世界知名紅茶主要產地主要有哪些國家

世界的四大名紅茶是:祁門紅茶,阿薩姆紅茶,大吉嶺紅茶,錫蘭高地紅茶。祁門紅茶:產於中國安徽省西南部黃山支脈區的祁門縣一帶。阿薩姆紅茶:產於印度東北阿薩姆喜馬拉雅山麓的阿薩姆溪谷一帶。吉嶺紅茶:產於印度西孟加拉省北部喜馬拉雅山麓的大吉嶺高原一帶。錫蘭高地紅茶:產於斯裡蘭卡,又被稱為西冷紅茶、惜蘭紅茶,

燕子為什麼老是在我家築窩啊

燕子喜歡在人類的房子屋簷上建窩,原因如下:1.藉助人的庇護,自然天敵比較少;2.牆壁和屋簷適合燕子巢的結構,野外類似的合適地形很有限;3.人類活動區域飛蟲較多,燈光和農田能吸引蟲子,這是燕子喜歡和人住在一起的最主要原因。