Maison > Java > javaDidacticiel > Comment puis-je améliorer la prise en charge d'Unicode dans les expressions régulières Java pour \w et \b ?

Comment puis-je améliorer la prise en charge d'Unicode dans les expressions régulières Java pour \w et \b ?

Mary-Kate Olsen
Libérer: 2024-12-10 11:03:13
original
219 Les gens l'ont consulté

How Can I Improve Unicode Support in Java Regular Expressions for w and b?

Équivalents Unicode pour w et b dans les expressions régulières Java

L'implémentation des expressions régulières de Java a une prise en charge limitée pour Unicode, ce qui rend difficile la correspondance de mots ou les limites des mots avec précision. Les échappements par défaut w et b correspondent uniquement aux caractères ASCII.

Pour résoudre ce problème, envisagez d'utiliser une fonction qui réécrit ces échappements, en les remplaçant par des définitions compatibles Unicode. Cette fonction peut réécrire les 14 échappements de classe de caractères suivants :

\w \W \s \S \v \V \h \H \d \D \b \B \X \R
Copier après la connexion

Définitions d'échappement réécrites :

  • w : capture les lettres, les chiffres et certains caractères de ponctuation. (p{L}pMp{Nd}p{Nl}p{Pc}[p{InEnclosedAlphanumerics}&&p{So}]])
  • W : exclut tous les caractères correspondant à w
  • s : correspond aux espaces Unicode ([u0009-u000Du0020u0085u00A0u1680u180Eu2000-u200Au2028u2029u202Fu205Fu3000])
  • S : exclut tous les caractères correspondant à s
  • v : correspond aux espaces verticaux Unicode ([u000A-u000Du0085u2028u2029])
  • V : exclut tous les caractères correspondant à v
  • h : correspond aux espaces horizontaux Unicode ([u0009u0020u00A0u1680u180Eu2000-u200Au202Fu205Fu3000])
  • H : exclut tous les caractères correspondant à h
  • d : correspond aux chiffres Unicode (p{Nd})
  • D : exclut tous les caractères correspondant par d
  • b : correspond aux limites des mots en tenant compte uniquement des caractères de mots Unicode
  • B : correspond aux limites non-mots en tenant compte des caractères de mots Unicode
  • X : correspond aux groupes de graphèmes étendus
  • R : correspond aux sauts de ligne, y compris la ligne Unicode ruptures

Définitions des limites :

Les évasions de limites (b et B) peuvent être réécrites en utilisant la logique suivante :

  • b : (?:(?<=w)(?!w)|(?
  • B : (?:(?<=w)(?= w)|(?

Correction de Java avec Java :

Cette fonction peut être implémenté en Java en utilisant le code fourni dans le fil de discussion d'origine. En utilisant ce code, vous pouvez réécrire les modèles d'expression régulière pour mieux gérer les caractères Unicode.

Remarque :
Dans Java 7, la classe Pattern introduit l'indicateur UNICODE_CHARACTER_CLASS, qui active la prise en charge d'Unicode pour ces évasions par défaut.

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

source:php.cn
Déclaration de ce site Web
Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn
Derniers articles par auteur
Tutoriels populaires
Plus>
Derniers téléchargements
Plus>
effets Web
Code source du site Web
Matériel du site Web
Modèle frontal