Digital humanities et recherche

Catégories

Tags

ajax archives bdd blog cn2sv digital humanities dublincore e-rudition encoded archival description film flux Google histoire ICEberg images informatisation interopérabilité iptc ist javascript kml mashup mathML mets mysql métadonnées OAI-PMH OAIS paris perl photos php pérennisation recherche ruby science simulation sources historiques standards super 8mm web 2.0 web of data xml xmp édition

Photos Flickr

holidays under hatclose"Aa"dsend of the daytizz tzz tizz tzz tizz... summer in the south

RSS MédiHAL

MathML et reconnaissance optique de formules mathématiques

Bonjour,
Après une semaine passée à installer le DataCenter du pôle HSTL de mon labo, J’ai travaillé hier sur l’OCéRisation de formules de mathématiques. Après un peu de veille, j’ai vu que cela n’était pas très facile et que les logiciels commerciaux classiques ne le permettait pas.

J’ai cependant trouvé une suite d’outil : Infty Project for Mathematical Document Recognition and Analysis, User Interface,Accessibility of Scientific Documents. Il s’agit d’une suite d’outils créé par Masakazu Suzuki (Kyushu University, Japon). J’ai testé InftyEditor et à première vue c’est très puissant. Cependant le module d’acquisition depuis un scanner ne fonctionne pas sur mon poste (j’ai pourtant un très bon scanner). Il faut donc scanner les documents indépendement du proscessus d’ORC. Autre limite, les formats possibles en entrée de chaîne : seul le TIFF binaire non compressé est possible. C’est un peu dommage car il semble que d’autres formats soient acceptés (PNG, JPEG, GIF), mais il s’agit peut-être un problème local venant de mes images.

L’intérêt principal reste la puissance de l’ORC et les formats de sortie : XML pour InftyEditor, LaTeX, MathML, PDF, etc. Mais le GROS problème c’est que les accents français ne sont pas gérés. C’est bien dommage. Mais c’est un outil à suivre…

Stéphane.

http://blog.stephanepouyllau.org/74